Image Classification (Görüntü Sınıflandırma)

Bir görüntüyü önceden tanımlanmış kategorilerden birine atayan temel bilgisayarlı görü görevidir.

Görüntü sınıflandırma (image classification), bir bilgisayar görü görevidir ve modelin girdi görüntüsünü önceden tanımlanmış kategorilerden birine atamasını gerektirir. Nesne tespiti bölge koordinatları, bölütleme piksel maskeleri çıkarırken sınıflandırma yalnızca "bu görüntüde ne var?" sorusunu yanıtlar. 2012 yılında AlexNet'in ImageNet Large Scale Visual Recognition Challenge (ILSVRC) yarışmasında derin evrişimli sinir ağlarını kullanarak top-5 hata oranını %26'dan %17'ye indirmesi alanın dönüm noktasıdır. Bunu VGGNet, GoogLeNet (Inception) ve 2015'te ResNet izledi; ResNet'in artık bağlantıları (residual connections) gradyan kaybını çözerek 152 katmanlı ağların eğitimini olanaklı kıldı. Bu gelişmeyle insan düzeyi doğruluğun (~%5 top-5 hata) altına inildi. Modern görüntü sınıflandırma ardışık düzeni şu adımları izler: ham pikseller evrişimli katmanlar aracılığıyla özellik haritalarına dönüştürülür; global havuzlama ile sabit boyutlu vektöre indirgenir; son katmanda Softmax fonksiyonu her sınıf için olasılık dağılımı üretir. Top-1 doğruluk (en yüksek olasılıklı sınıf) ve top-5 doğruluk (ilk beş tahmin içinde gerçek sınıfın bulunması) temel değerlendirme metrikleridir. Transfer öğrenme uygulamalarda belirleyici hâle gelmiştir: ImageNet'te ön eğitilmiş bir model alınarak son katmanları hedefe özgü sınıflar için ince ayar yapılır. Bu yöntem veri gereksinimini ve eğitim süresini önemli ölçüde azaltır. EfficientNet, bileşik ölçeklendirme ile doğruluk ve hesaplama verimliliğini birlikte optimize eden bir yaklaşım sunarken Vision Transformer (ViT), 2020'den itibaren saf dikkat mekanizmasıyla CNN tabanlı modellere kıyaslanabilir performans elde etmiştir. ConvNeXt ise Transformer tasarım ilkelerini CNN mimarisine taşıyarak 2022'de kıyaslama tablolarında üst sıralara yerleşmiştir. Tıbbi görüntüleme (radyoloji, patoloji), tarımsal zararlı ve hastalık tespiti, kalite kontrol sistemleri ve uydu görüntüsü analizi başlıca uygulama alanlarını oluşturmaktadır. Öte yandan, eğitim dağılımından farklı verilerle performansın dramatik düşmesi (dağılım kayması) ve önyargılı eğitim kümelerinden kaynaklanan adalet sorunları, uygulamalarda dikkat edilmesi gereken kritik kısıtlamalardır.

Görüntü Sınıflandırma Nedir?

Görüntü sınıflandırma (image classification), bir modelin girdi görüntüsünü önceden tanımlanmış kategorilerden birine atadığı temel bilgisayarlı görü görevidir. Nesne tespiti (bölge koordinatları) ve bölütleme (piksel maskeleri) ile karşılaştırıldığında sınıflandırma yalnızca "bu görüntüde ne var?" sorusunu yanıtlar. ImageNet veri kümesi; 1.000 farklı sınıf ve 1,2 milyon eğitim görüntüsüyle bu görevin standart kıyaslama platformunu oluşturur.

AlexNet ve Derin Öğrenme Devrimi

2012 yılında AlexNet, ImageNet Large Scale Visual Recognition Challenge'da (ILSVRC) derin CNN kullanarak top-5 hata oranını %26'dan %17'ye indirdi. Bu başarı, bilgisayarlı görüde derin öğrenmenin egemenliğinin başlangıcını işaret eder. Ardından VGGNet (daha derin ağlar), GoogLeNet/Inception (darboğaz katmanları) ve 2015'te ResNet (artık bağlantılar) geldi. ResNet'in residual bağlantıları, 152 katmanlı ağların eğitimini olanaklı kıldı ve insan düzeyi doğruluğun (~%5 top-5 hata) altına inildi.

Öne Çıkan Mimariler

🔗 ResNet

Microsoft'un 2015'te geliştirdiği artık bağlantı mimarisi. 50, 101, 152 katmanlı versiyonları; gradyan kaybı olmadan derin eğitimi olanaklı kılar. ImageNet'te %3.57 top-5 hata ile insan düzeyini geçti.

EfficientNet

Google'ın 2019'da sunduğu bileşik ölçeklendirme yaklaşımı: derinlik, genişlik ve çözünürlük aynı anda optimize edilir. EfficientNet-B7 ile ImageNet'te %84.3 top-1 doğruluk; hesaplama maliyeti düşük.

👁️ Vision Transformer (ViT)

2020'de Google'ın NLP Transformer mimarisini görüntüye uyarladığı model. Görüntüyü 16×16 piksel yamalara böler; büyük ölçekli ön eğitimde CNN'e eşdeğer veya üstün sonuçlar alır.

🏗️ ConvNeXt

Meta'nın 2022'de Transformer tasarım ilkelerini (layer norm, GELU, depthwise conv) CNN'e taşıdığı mimari. ViT ile kıyaslanabilir doğruluk; CNN'in hız ve basitlik avantajını korur.

Transfer Öğrenme ile Pratikte Kullanım

Transfer öğrenme, görüntü sınıflandırmanın pratiğini köklü biçimde dönüştürmüştür. ImageNet'te ön eğitilmiş bir modelin ağırlıkları başlangıç noktası olarak alınır; yalnızca son katmanlar hedef sınıflara göre ince ayar yapılır (fine-tuning). Bu yaklaşım veri gereksinimini onlarca kat, eğitim süresini saatlerden dakikalara indirir. PyTorch Hub ve HuggingFace üzerinden önceden eğitilmiş ağırlıklara tek satır kodla erişmek mümkündür. Dondurulmuş katmanlar stratejisi (frozen backbone) küçük veri kümelerinde özellikle etkilidir.

Değerlendirme Metrikleri ve Sınırlamalar

Top-1 doğruluk (en yüksek olasılıklı tahmin), Top-5 doğruluk ve sınıf bazlı F1 skoru temel değerlendirme metrikleridir. Karmaşıklık matrisi, sınıflar arası karışıklıkları görselleştirir. Temel sınırlamalar: eğitim dağılımından farklı test verisinde performans düşer (dağılım kayması); önyargılı eğitim kümeleri adaletsiz sınıflandırmalara yol açar; çoklu nesne içeren görüntülerde tek etiket yetersiz kalır.

Sık Sorulan Sorular

  • check_circle Görüntü sınıflandırma ile nesne tespiti farkı nedir?: Sınıflandırma tüm görüntüye tek etiket atar ('kedi'). Nesne tespiti ise birden fazla nesneyi bounding box koordinatlarıyla birlikte sınıflandırır. Bölütleme piksel düzeyinde maske çıkarır.
  • check_circle Kendi sınıflandırıcımı eğitmek için kaç görüntü gerekir?: Transfer öğrenme ile sınıf başına 50-200 görüntü yeterli olabilir. Sıfırdan eğitim için sınıf başına binlerce görüntü gerekebilir. Veri artırma küçük kümelerini güçlendirir.
  • check_circle ResNet mi, ViT mi kullanmalıyım?: Küçük veri kümelerinde ResNet/EfficientNet genellikle daha kararlıdır. Büyük ölçekli ön eğitimde (CLIP, DINOv2) ViT üstündür. Donanım kısıtı varsa MobileNet veya EfficientNet-B0 değerlendirilebilir.
  • check_circle ImageNet doğruluğu gerçek dünya performansını yansıtır mı?: Her zaman değil. Farklı ortamlarda (kamera açısı, aydınlatma) modeller kötü genelleme yapabilir. Hedef alana özgü doğrulama veri kümesiyle test etmek şarttır.
  • check_circle Türkiye'de görüntü sınıflandırma nerelerde kullanılıyor?: Tarımsal zararlı tespiti, tekstil kalite kontrolü, akıllı şehir kamerası analitiği, tele-tıp radyoloji desteği ve uydu tabanlı arazi kullanımı tespiti öne çıkan uygulamalardır.