tag GorselAI
Image Recognition (Görüntü Tanıma)
Bu sayfada GorselAI (Image Recognition (Görüntü Tanıma)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Image recognition (görüntü tanıma), bilgisayar sistemlerinin dijital görüntüler veya video karelerindeki nesneleri, yüzleri, sahneleri ve kalıpları otomatik olarak tanımlayıp sınıflandırma yeteneğidir. İnsan görsel korteksinin işlevini taklit etmeyi hedefleyen bu teknoloji, yapay zeka ve bilgisayarlı görünün (computer vision) en temel uygulamalarından biridir. Görüntü tanımanın kökleri 1960'lara uzanmakla birlikte, teknoloji 2012 yılında gerçek anlamda devrim yaşadı. Geoffrey Hinton liderliğindeki Toronto Üniversitesi ekibi, AlexNet adlı derin öğrenme modeliyle ImageNet görüntü sınıflandırma yarışmasını (ILSVRC) kazanarak hata oranını yüzde 26'dan yüzde 15'e düşürdü. Bu başarı, geleneksel el yapımı özelliklerin (SIFT, HOG) yerini derin sinir ağlarına bırakma sürecini başlattı. Modern görüntü tanıma sistemleri, Evrişimli Sinir Ağları (CNN) üzerine kuruludur. CNN mimarisi, görüntüdeki kenar ve köşeler gibi düşük seviyeli özelliklerden başlayarak giderek daha soyut gösterimlere —kulaklar, gözler, yüzler gibi— doğru ilerler. ResNet (derin kalıntı ağları), EfficientNet ve DenseNet farklı hız-doğruluk dengelerinde kullanılır. 2020'den itibaren Vision Transformer (ViT) mimarileri de rekabetçi sonuçlar vererek CNN'lerle yarışmaktadır. CLIP (Contrastive Language-Image Pre-training) ise metin-görüntü öğrenimini birleştirerek sıfır-atış tanıma kabiliyeti kazandırmaktadır. Görüntü tanıma genel bir çatı kavramdır; altında birkaç farklı görev bulunur: Görüntü sınıflandırma tüm görüntüye tek bir etiket atarken, nesne tespiti (object detection) birden fazla nesnenin sınıfını ve konumunu (bounding box) aynı anda belirler. Anlamsal bölütleme (semantic segmentation) her pikseli bir sınıfla etiketler, örnek bölütleme (instance segmentation) ise her nesne kopyasını ayrı ayrı maskeler. Uygulama alanları son derece geniştir: tıbbi görüntülemede kanser tespiti, otonom araçlarda trafik işareti ve yaya tanıma, e-ticarette görsel ürün arama, üretim hatlarında kalite kontrolü ve güvenlik sistemlerinde yüz doğrulama bunların başında gelir. Değerlendirme metrikleri arasında ImageNet'teki Top-1 ve Top-5 doğruluk oranları en yaygın kullanılanlarıdır; nesne tespiti görevlerinde ise ortalama hassasiyet (mAP) ve Birleşim Üzerinden Kesişim (IoU) tercih edilir.
Image Recognition (Görüntü Tanıma)
Image recognition (görüntü tanıma), bilgisayar sistemlerinin dijital görüntüler veya video karelerindeki nesneleri, yüzleri, sahneleri ve kalıpları otomatik olarak tanımlayıp sınıflandırma yeteneğidir. İnsan görsel korteksinin işlevini taklit etmeyi hedefleyen bu teknoloji, yapay zeka ve bilgisayarlı görünün (computer vision) en temel uygulamalarından biridir. Görüntü tanımanın kökleri 1960'lara uzanmakla birlikte, teknoloji 2012 yılında gerçek anlamda devrim yaşadı. Geoffrey Hinton liderliğindeki Toronto Üniversitesi ekibi, AlexNet adlı derin öğrenme modeliyle ImageNet görüntü sınıflandırma yarışmasını (ILSVRC) kazanarak hata oranını yüzde 26'dan yüzde 15'e düşürdü. Bu başarı, geleneksel el yapımı özelliklerin (SIFT, HOG) yerini derin sinir ağlarına bırakma sürecini başlattı. Modern görüntü tanıma sistemleri, Evrişimli Sinir Ağları (CNN) üzerine kuruludur. CNN mimarisi, görüntüdeki kenar ve köşeler gibi düşük seviyeli özelliklerden başlayarak giderek daha soyut gösterimlere —kulaklar, gözler, yüzler gibi— doğru ilerler. ResNet (derin kalıntı ağları), EfficientNet ve DenseNet farklı hız-doğruluk dengelerinde kullanılır. 2020'den itibaren Vision Transformer (ViT) mimarileri de rekabetçi sonuçlar vererek CNN'lerle yarışmaktadır. CLIP (Contrastive Language-Image Pre-training) ise metin-görüntü öğrenimini birleştirerek sıfır-atış tanıma kabiliyeti kazandırmaktadır. Görüntü tanıma genel bir çatı kavramdır; altında birkaç farklı görev bulunur: Görüntü sınıflandırma tüm görüntüye tek bir etiket atarken, nesne tespiti (object detection) birden fazla nesnenin sınıfını ve konumunu (bounding box) aynı anda belirler. Anlamsal bölütleme (semantic segmentation) her pikseli bir sınıfla etiketler, örnek bölütleme (instance segmentation) ise her nesne kopyasını ayrı ayrı maskeler. Uygulama alanları son derece geniştir: tıbbi görüntülemede kanser tespiti, otonom araçlarda trafik işareti ve yaya tanıma, e-ticarette görsel ürün arama, üretim hatlarında kalite kontrolü ve güvenlik sistemlerinde yüz doğrulama bunların başında gelir. Değerlendirme metrikleri arasında ImageNet'teki Top-1 ve Top-5 doğruluk oranları en yaygın kullanılanlarıdır; nesne tespiti görevlerinde ise ortalama hassasiyet (mAP) ve Birleşim Üzerinden Kesişim (IoU) tercih edilir.
Instance Segmentation (Örnek Bölütleme)
Instance Segmentation (Örnek Bölütleme), bilgisayarlı görünün en gelişmiş görevlerinden biridir. Bir görüntüdeki her nesne örneğini piksel düzeyinde tespit edip birbirinden bağımsız olarak maskeleyen bu yöntem, nesne tespitinin (object detection) konumsal doğruluğunu ile semantik bölütlemenin (semantic segmentation) piksel hassasiyetini tek çatı altında birleştirir. Semantik Bölütlemeden Farkı: Semantik bölütleme "bu piksel araba sınıfına ait" der; ancak görüntüdeki iki arabayı tek bir kütle olarak ele alır. Örnek bölütleme ise her nesneye ayrı bir piksel maskesi atar: "bu Araba #1, şu Araba #2." Bu ayrım gerçek dünya uygulamalarında kritik önem taşır; otonom araçların birden fazla yayayı bağımsız takip etmesi, cerrahi robotların doku katmanlarını ayırt etmesi veya depo otomasyonunun üst üste yığılmış kutuları tek tek kavraması bu farkı gerektirir. Temel Mimariler: Mask R-CNN (He et al., 2017) bu alanın dönüm noktasıdır. Faster R-CNN'in bölgesel öneri mekanizmasına piksel maskesi çıkaran bir maske başlığı (mask head) ekleyerek her nesne için ayrı ikili maske üretir. YOLOv8-seg ve YOLOv9-seg gibi tek aşamalı (one-stage) modeller gerçek zamanlı uygulamalar için Mask R-CNN'e kıyasla çok daha hızlı bir alternatif sunar. Meta AI'ın 2023'te tanıttığı Segment Anything Model (SAM), nokta, kutu veya metin ipuçlarıyla sıfır atış (zero-shot) bölütleme yapabilen evrensel bir temel modeldir; fine-tuning gerektirmeksizin hemen her nesneyi maskeler. Mask2Former (2022) ise sorgu tabanlı (query-based) Transformer mimarisini benimseyerek panoptik, semantik ve örnek bölütlemeyi tek bir çerçevede birleştirir. Panoptik Bölütleme: Örnek bölütlemenin uzantısı olan panoptik bölütleme (panoptic segmentation), sayılabilir nesneleri (things: araba, kişi) ve sayılamaz bölgeleri (stuff: gökyüzü, zemin) eş zamanlı olarak maskeler. Değerlendirme Metrikleri: COCO veri kümesinde AP (Average Precision) farklı IoU eşiklerinde ölçülür: AP50, AP75 ve AP50:95 en yaygın kriterlerdir. Panoptik görevlerde Panoptic Quality (PQ) metriği hem tanıma hem bölütleme başarısını birlikte değerlendirir. Yüksek doğruluk için güçlü GPU gereklidir; ancak YOLOv8-seg ve SAM'ın mobil versiyonları edge cihazlarda çalışabilmektedir.