Object Detection (Nesne Tespiti / Nesne Tanıma)

Görüntüde nesnelerin varlığını ve konumunu bounding box ile belirleyen bilgisayarlı görü tekniği.

Nesne tespiti (object detection), bir görüntüde veya videodaki nesnelerin hem varlığını hem de konumunu otomatik olarak belirleyen bilgisayarlı görü tekniğidir. Yalnızca görüntünün genelinde ne olduğunu söyleyen görüntü sınıflandırmasının aksine nesne tespiti her nesnenin çevresine bir sınır kutusu (bounding box) çizer ve nesneyi etiketler. Nesne tespiti sistemleri iki ana kategoride incelenir. İki aşamalı detektörler (two-stage detectors), önce potansiyel nesne bölgeleri önerir (Region Proposal Network), ardından bu bölgeleri sınıflandırır. Faster R-CNN bu kategorinin öncü modelidir. Tek aşamalı detektörler (one-stage detectors), tahmin ve sınıflandırmayı tek bir geçişte gerçekleştirir; YOLO serisi ve SSD bu kategorinin en bilinen modelleridir. YOLO'nun evrimi nesne tespitinin tarihini özetler: YOLOv1 (2016), YOLOv3, YOLOv5, YOLOv8 ve YOLOv11'e uzanan her sürümde hız/doğruluk dengesi iyileştirilmiştir. Ultralytics'in YOLOv8'i, kolay kullanım ve güçlü performanıyla topluluk standardı haline gelmiştir. Transformer tabanlı DETR (Detection Transformer), bounding box tahmini ile dikkat mekanizmasını birleştirerek alanı yenilemiş; anchor-free tasarımıyla geleneksel bileşenlere olan bağımlılığı azaltmıştır. Değerlendirme metriği olarak mAP (mean Average Precision) kullanılır; bu metrik, farklı IoU (Intersection over Union) eşiklerindeki precision-recall eğrisinin altındaki alan ortalamasını ölçür. COCO veri kümesi, nesne tespiti modellerinin karşılaştırılması için endüstri standardı haline gelmiştir. Gerçek zamanlı uygulamalarda (otonom araçlar, güvenlik kameraları, drone görüntü analizi) düşük gecikme kritik olduğundan tek aşamalı detektörler ön plana çıkar. Örnek olarak YOLOv8n (nano), CPU üzerinde 60+ FPS hızında çalışabilirken YOLOv8x (extra large) COCO'da daha yüksek mAP değerleri elde eder. Model seçimi, donanım kısıtları ve doğruluk gereksinimine göre yapılmalıdır; TensorRT ve ONNX optimizasyonu üretim dağıtımında gecikmeyi önemli ölçüde düşürür; bu sayede edge cihazlarda bile gerçek zamanlı çıkarım mümkün olur. Instance segmentation (YOLOv8-seg, Mask R-CNN) ve keypoint detection gibi türev görevler, nesne tespiti altyapısını piksel düzeyi veya iskelet bazlı analizle genişletir.

Sınıflandırma ile Nesne Tespiti Farkı

Görüntü sınıflandırması görüntünün bütününde tek bir etiket üretir: 'bu görüntüde kedi var'. Nesne tespiti ise görüntüde birçok nesne olabileceğini kabul eder ve her birini bireysel olarak konumlandırır: 'koordinat (x1,y1,x2,y2)'da kedi, koordinat (a1,b1,a2,b2)'de köpek'. Birçok gerçek dünya uygulaması (otonom araç, güvenlik kamerası, medikal görüntüleme) doğruluk ve konum bilgisini birlikte gerektirir.

YOLO: Gerçek Zamanlı Tespit

You Only Look Once (YOLO), görüntüyü bir kez işleyerek tüm nesne tespitini tek bir sinir ağı geçişinde gerçekleştirir. Bu tek geçiş yaklaşımı, gerçek zamanlı uygulamalarda çok daha hızlı çıkarsama sağlar. YOLOv8 (Ultralytics, 2023), görüntü segmentasyonu ve poz tahmini de dahil olmak üzere çok görevli destek ile geliştirilmiştir. CLI ve Python API ile kolayca kullanılabilen YOLOv8, hem araştırma hem üretim ortamlarında tercih edilmektedir.

Transformer Tabanlı DETR

Facebook Research'ün DETR (Detection Transformer) modeli, anchor box kavramı yerine dikkat mekanizmasını kullanıyor. Görüntü CNN ile özellik haritasına dönüştürüldükten sonra transformer encoder-decoder ile nesne sorguları guruluyor. DETR, uzun kuyruk tespit görevlerinde ve oklüzyon (örtüşen nesneler) senaryolarında bazı avantajlar sunmaktadır. Sonraki modeller (Deformable DETR, DINO) bu yaklaşımı daha da hızlandırmıştır.

Uygulama Alanları

Otonom araçlarda kamera ve LiDAR verileriyle yaya, araç ve trafik işareti tespiti. Sağlıkta medikal görüntüde tümör veya lezyon lokalizasyonu. Perakendede raf stok analizi ve kasasız ödeme sistemleri (Amazon Go). Güvenlikte kamera sistemi izleme. Tarımda insansız hava aracı görüntüleriyle hasat ve hastalık tespiti. Her sektörde gerçek zamanlı otomatik görsel analiz kritik katma değer sağlar.

📦 Nesne Tespiti Model Seçim Rehberi

  • check_circle YOLO serisi: gerçek zamanlı tek aşamalı tespit; kenar cihazlar ve video analizi için ideal
  • check_circle Faster R-CNN: iki aşamalı yüksek doğruluk; tıbbi görüntüleme gibi hassas uygulamalar için
  • check_circle DETR: transformer tabanlı uçtan uca tespit; kutu önerisi ve NMS aşamalarına gerek yok
  • check_circle SSD: çok ölçekli özellik haritalarında tespit; mobil uygulamalar için hız-doğruluk dengesi
  • check_circle RT-DETR (Baidu): gerçek zamanlı DETR; YOLO hızında transformer doğruluğu sunar

Sıkça Sorulan Sorular

YOLO mu Faster R-CNN mi kullanmalıyım? Gerçek zamanlı veya uç cihaz için YOLO; maksimum doğruluk gerektiren offline analiz için Faster R-CNN.

mAP %50 iyi bir sonuç mu? Alana göre değişir. COCO'da state-of-the-art modeller %60 üstündedir; üretim için kullanım senaryosuna göre kabul kriteri belirlenir.

YOLOv8'i nasıl başlatacağım? pip install ultralytics sonra yolo detect predict model=yolov8n.pt source='image.jpg' komutu yeterlidir.

Bounding box ile segmentasyon farkı nedir? Bounding box nesne çevresinde dikdörtgen; segmentasyon piksel düzeyinde nesne maskesi üretir. Mask R-CNN her ikisini birlikte yapar.