tag imagenet

Image Classification (Görüntü Sınıflandırma)

Bu sayfada imagenet (Image Classification (Görüntü Sınıflandırma)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Görüntü sınıflandırma (image classification), bir bilgisayar görü görevidir ve modelin girdi görüntüsünü önceden tanımlanmış kategorilerden birine atamasını gerektirir. Nesne tespiti bölge koordinatları, bölütleme piksel maskeleri çıkarırken sınıflandırma yalnızca "bu görüntüde ne var?" sorusunu yanıtlar. 2012 yılında AlexNet'in ImageNet Large Scale Visual Recognition Challenge (ILSVRC) yarışmasında derin evrişimli sinir ağlarını kullanarak top-5 hata oranını %26'dan %17'ye indirmesi alanın dönüm noktasıdır. Bunu VGGNet, GoogLeNet (Inception) ve 2015'te ResNet izledi; ResNet'in artık bağlantıları (residual connections) gradyan kaybını çözerek 152 katmanlı ağların eğitimini olanaklı kıldı. Bu gelişmeyle insan düzeyi doğruluğun (~%5 top-5 hata) altına inildi. Modern görüntü sınıflandırma ardışık düzeni şu adımları izler: ham pikseller evrişimli katmanlar aracılığıyla özellik haritalarına dönüştürülür; global havuzlama ile sabit boyutlu vektöre indirgenir; son katmanda Softmax fonksiyonu her sınıf için olasılık dağılımı üretir. Top-1 doğruluk (en yüksek olasılıklı sınıf) ve top-5 doğruluk (ilk beş tahmin içinde gerçek sınıfın bulunması) temel değerlendirme metrikleridir. Transfer öğrenme uygulamalarda belirleyici hâle gelmiştir: ImageNet'te ön eğitilmiş bir model alınarak son katmanları hedefe özgü sınıflar için ince ayar yapılır. Bu yöntem veri gereksinimini ve eğitim süresini önemli ölçüde azaltır. EfficientNet, bileşik ölçeklendirme ile doğruluk ve hesaplama verimliliğini birlikte optimize eden bir yaklaşım sunarken Vision Transformer (ViT), 2020'den itibaren saf dikkat mekanizmasıyla CNN tabanlı modellere kıyaslanabilir performans elde etmiştir. ConvNeXt ise Transformer tasarım ilkelerini CNN mimarisine taşıyarak 2022'de kıyaslama tablolarında üst sıralara yerleşmiştir. Tıbbi görüntüleme (radyoloji, patoloji), tarımsal zararlı ve hastalık tespiti, kalite kontrol sistemleri ve uydu görüntüsü analizi başlıca uygulama alanlarını oluşturmaktadır. Öte yandan, eğitim dağılımından farklı verilerle performansın dramatik düşmesi (dağılım kayması) ve önyargılı eğitim kümelerinden kaynaklanan adalet sorunları, uygulamalarda dikkat edilmesi gereken kritik kısıtlamalardır.

code_blocks

Image Classification (Görüntü Sınıflandırma)

Görüntü sınıflandırma (image classification), bir bilgisayar görü görevidir ve modelin girdi görüntüsünü önceden tanımlanmış kategorilerden birine atamasını gerektirir. Nesne tespiti bölge koordinatları, bölütleme piksel maskeleri çıkarırken sınıflandırma yalnızca "bu görüntüde ne var?" sorusunu yanıtlar. 2012 yılında AlexNet'in ImageNet Large Scale Visual Recognition Challenge (ILSVRC) yarışmasında derin evrişimli sinir ağlarını kullanarak top-5 hata oranını %26'dan %17'ye indirmesi alanın dönüm noktasıdır. Bunu VGGNet, GoogLeNet (Inception) ve 2015'te ResNet izledi; ResNet'in artık bağlantıları (residual connections) gradyan kaybını çözerek 152 katmanlı ağların eğitimini olanaklı kıldı. Bu gelişmeyle insan düzeyi doğruluğun (~%5 top-5 hata) altına inildi. Modern görüntü sınıflandırma ardışık düzeni şu adımları izler: ham pikseller evrişimli katmanlar aracılığıyla özellik haritalarına dönüştürülür; global havuzlama ile sabit boyutlu vektöre indirgenir; son katmanda Softmax fonksiyonu her sınıf için olasılık dağılımı üretir. Top-1 doğruluk (en yüksek olasılıklı sınıf) ve top-5 doğruluk (ilk beş tahmin içinde gerçek sınıfın bulunması) temel değerlendirme metrikleridir. Transfer öğrenme uygulamalarda belirleyici hâle gelmiştir: ImageNet'te ön eğitilmiş bir model alınarak son katmanları hedefe özgü sınıflar için ince ayar yapılır. Bu yöntem veri gereksinimini ve eğitim süresini önemli ölçüde azaltır. EfficientNet, bileşik ölçeklendirme ile doğruluk ve hesaplama verimliliğini birlikte optimize eden bir yaklaşım sunarken Vision Transformer (ViT), 2020'den itibaren saf dikkat mekanizmasıyla CNN tabanlı modellere kıyaslanabilir performans elde etmiştir. ConvNeXt ise Transformer tasarım ilkelerini CNN mimarisine taşıyarak 2022'de kıyaslama tablolarında üst sıralara yerleşmiştir. Tıbbi görüntüleme (radyoloji, patoloji), tarımsal zararlı ve hastalık tespiti, kalite kontrol sistemleri ve uydu görüntüsü analizi başlıca uygulama alanlarını oluşturmaktadır. Öte yandan, eğitim dağılımından farklı verilerle performansın dramatik düşmesi (dağılım kayması) ve önyargılı eğitim kümelerinden kaynaklanan adalet sorunları, uygulamalarda dikkat edilmesi gereken kritik kısıtlamalardır.

arrow_forward