Image Captioning (Görüntü Altyazılama)

Derin öğrenme modelleri kullanılarak görüntülere otomatik olarak metin açıklaması üreten yapay zeka tekniği.

Image Captioning (Görüntü Altyazılama), bir görüntünün içeriğini otomatik olarak doğal dilde metin olarak tanımlayan yapay zeka tekniğidir. Görüntü encoder'ı (genellikle Vision Transformer veya CNN) ile metin decoder'ını (dil modeli) bir araya getiren çok modlu (multimodal) bir yaklaşımdır. Sistem, görüntüden çıkarılan öznitelikleri dil bileşenine aktararak "Bu fotoğrafta bir köpek çimenlerin üzerinde oturuyor" gibi açıklayıcı cümleler üretir. BLIP, GIT, Flamingo ve LLaVA gibi modern modeller bu alanda öne çıkan mimarilerdir. Erişilebilirlik (görme engelliler için alt metin), içerik moderasyonu, görsel arama ve veri etiketleme gibi geniş bir uygulama alanına sahiptir.

Görüntü Altyazılama Yöntemleri ve Mimarileri

  • check_circle CNN + RNN Yaklaşımı (Klasik): ResNet/VGG görsel özellik çıkarımı, LSTM metin üretimi. Show and Tell (Google, 2014) bu paradigmanın miladı; modern yöntemlere kıyasla sınırlı kalite.
  • check_circle Transformer Tabanlı Modeller: Vision Transformer (ViT) görüntüyü patch'lere böler, Transformer metin üretir. BLIP, BLIP-2 ve CoCa bu mimarinin başarılı temsilcileri.
  • check_circle Büyük Multimodal Modeller: GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 ve LLaVA; görüntüden ayrıntılı, bağlamsal altyazı üretebilir. Karmaşık sahneleri metin olarak açıklama, nesne ilişkilerini yorumlama.
  • check_circle BLIP-2 Mimarisi: Q-Former köprüsü görsel ve dil modellerini bağlar; dondurulmuş görüntü ve dil modeli arasında etkin bilgi transferi. Az parametre ile güçlü performans.
  • check_circle Erişilebilirlik Uygulamaları: Görme engelliler için ekran okuyuculara entegre altyazılama; Microsoft Seeing AI ve Google Lookout gerçek zamanlı görsel açıklama sağlar.
  • check_circle Tıbbi Görüntü Altyazılama: Röntgen, MRI ve patoloji görüntülerinden radyoloji raporu taslağı oluşturma. CheXNet ve BioViL bu alanda öncü modellerdir; klinisyen doğrulaması zorunludur.
  • check_circle Değerlendirme Metrikleri: BLEU (n-gram örtüşme), METEOR (anlamsal benzerlik), CIDEr (TF-IDF ağırlıklı) ve SPICE (sahne grafiği tabanlı) altyazı kalitesini farklı açılardan ölçer.

Görüntü Altyazılamanın Pratik Uygulamaları ve Güncel Gelişmeler

Görüntü altyazılama (image captioning), bir yapay zeka modelinin bir fotoğrafı veya görseli doğal dilde betimlemesidir. Bu görev, görsel anlayışın temel kıyaslama problemi olarak 2010'ların başından beri araştırılmaktadır. Günümüzde büyük multimodal modellerin yaygınlaşmasıyla birlikte altyazılama kalitesi dramatik biçimde artmış; modeller artık basit nesne listelemenin ötesinde sahne bağlamı, duygu tonu ve karmaşık mekânsal ilişkileri betimleyebilmektedir. Pratik kullanım alanları oldukça geniştir: e-ticaret katalogları için otomatik ürün açıklaması üretimi, sosyal medya platformlarında görüntüye otomatik alt metin ekleme, arama motorları için görselleri dizinleme ve güvenlik kameralarından olay açıklaması oluşturma. Türkçe altyazılama için pratik seçenekler: GPT-4o ve Claude 3.5 Sonnet API'leri görüntüyü Türkçe açıklama konusunda doğrudan kullanılabilir. Yerel ve açık kaynak tercihler için LLaVA-Turkish ince ayarlı modeller Hugging Face'de mevcuttur. Kalite değerlendirmesinde insan tercih değerlendirmesi (human preference eval) otomatik metriklerin ötesinde daha güvenilir bir ölçüt olmaya devam etmektedir.