Image Captioning (Görüntü Altyazılama)

Görüntülerin içeriğini otomatik olarak doğal dilde metne çeviren çok modlu yapay zeka tekniği.

Image Captioning (Görüntü Altyazılama), bir görüntünün içeriğini otomatik olarak doğal dilde açıklayan çok modlu (multimodal) yapay zeka tekniğidir. Erişilebilirlik alt metni üretmekten e-ticaret ürün açıklamasına, güvenlik kamerası analizinden tıbbi görüntü raporlamasına uzanan geniş bir kullanım yelpazesine sahiptir. Teknik açıdan modern sistemler encoder-decoder çerçevesine dayanır. Görüntü encoder'ı (ViT, CNN veya bunların birleşimi), piksel matrisini yoğun bir özellik vektörüne sıkıştırır. Metin decoder'ı (genellikle transformer tabanlı bir dil modeli), bu vektörü koşul olarak alarak sözcük sözcük açıklamayı üretir. Eğitim için görüntü-metin çifti veri setleri kullanılır: MS-COCO (her görüntü için 5 farklı insan referansı), Flickr30K ve Conceptual Captions başlıca kaynaklardır. 2022'de Salesforce'un yayımladığı BLIP (Bootstrapping Language-Image Pre-Training), web'den derlenen gürültülü görüntü-altyazı çiftlerini kendi kendine filtreleyerek eğitim kalitesini artırdı. Microsoft'un GIT (Generative Image-to-Text) modeli, her decoder katmanına görsel özellik enjekte ederek metinsel bağlamı korur. Google DeepMind'ın Flamingo modeli büyük dil modelini görsel girdi ile koşullandırarak few-shot image captioning'de yeni referanslar belirledi. BLIP-2, LLaVA ve Qwen-VL gibi daha yeni sistemler ise görüntü altyazılamanın ötesine geçerek görsel soru yanıtlama (VQA) ve yönerge takibini tek mimaride birleştirmektedir. Değerlendirmede BLEU, METEOR ve ROUGE gibi metin benzerliği metrikleri yanı sıra, image captioning'e özgü CIDEr (Consensus-based Image Description Evaluation) ve SPICE metrikleri kullanılır. CIDEr, insan referans açıklamalarıyla konsensüse dayalı n-gram benzerliğini ölçer; SPICE ise sahne grafiği (scene graph) ayrıştırması yaparak anlamsal doğruluğu değerlendirir. Türkiye'de erişilebilirlik mevzuatı (Ekim 2023'ten itibaren kamu web sitelerinde WCAG 2.1 AA zorunluluğu) görüntü altyazılama teknolojisine kurumsal talebi artırmaktadır. E-ticaret platformları görsel ürün kataloğunu metin olarak indeksleyerek arama motorlarında görünürlük elde etmekte; medya ve yayın arşivleri tarihî fotoğrafları otomatik etiketlemek için bu teknikten yararlanmaktadır.

Görüntü Altyazılama Nasıl Çalışır?

Modern image captioning sistemleri encoder-decoder mimarisine dayanır. Görüntü encoder'ı (ViT veya CNN tabanlı), ham piksel verisini kompakt bir anlam vektörüne dönüştürür; bu vektör, sahnenin 'özü'nü sayısal olarak özetler. Metin decoder'ı, bu vektörü başlangıç koşulu olarak alır ve bir dil modelinin token-by-token tahmin mantığıyla açıklama cümlesini oluşturur. Eğitim, büyük görüntü-metin çifti veri setleri (MS-COCO, Flickr30K, Conceptual Captions) üzerinde kontrastif veya çapraz-entropi kaybıyla yürütülür. CLIP ve benzeri görsel-dil ön-eğitim modelleri, her iki modalitede de anlam hizalaması kurarak modern captioning sistemlerinin omurgasını oluşturur.

Öne Çıkan Modeller

BLIP-2 (Salesforce, 2023)

Donuk görüntü encoder ile donuk LLM arasına hafif bir Q-Former modülü yerleştirir. Milyarlarca parametreli LLM'i eğitmeden görsel anlama aktarır. Görsel soru yanıtlama ve altyazılama için açık kaynak referans model.

🦅 LLaVA (2023-2024)

CLIP görüntü encoder'ı ile Llama/Mistral tabanlı LLM'i lineer projeksiyon katmanıyla birleştirir. Yönerge ayarlama (instruction tuning) ile görsel diyalog yeteneği kazanır. Açık kaynak, yerel çalıştırmaya uygundur.

🔬 Flamingo (DeepMind, 2022)

Büyük dil modelini Perceiver Resampler ile görsel girdi üzerine koşullandırır. Few-shot image captioning'de çığır açtı: yalnızca birkaç görüntü-metin örneğiyle yeni görevlere uyum sağlar. Gated cross-attention mekanizması kullanır.

Değerlendirme Metrikleri

Image captioning sistemleri, üretilen metnin referans insan açıklamalarına ne kadar yakın olduğuyla ölçülür. BLEU (Bilingual Evaluation Understudy), n-gram örtüşmesini hesaplar; orijinali makine çevirisi değerlendirmesi olan bu metrik, image captioning için de temel kıyaslama sağlar. METEOR, kökleme ve eşanlamlıları da dikkate alarak BLEU'nun katı sözcük eşleşme sınırını aşar. CIDEr (Consensus-based Image Description Evaluation) ise image captioning'e özeldir: birden fazla referans açıklamasına karşı TF-IDF ağırlıklı n-gram benzerliği hesaplayarak daha anlamlı kalite tahmini sunar. SPICE, sahne grafiği ayrıştırması yaparak nesne, özellik ve ilişki bazında anlam doğruluğunu değerlendirir; CIDEr ve SPICE birlikte modern benchmark'ların standart çifti hâline gelmiştir.

Uygulama Alanları

Erişilebilirlik, image captioning'in en kritik uygulama alanıdır: görme engelli kullanıcılar için web içeriğindeki görüntülere otomatik alt metin (alt-text) üretimi WCAG 2.1 standardının zorunlu gereksinimi hâline gelmektedir. E-ticaret platformları, görsel ürün kataloğunu metin olarak indeksleyerek arama motoru görünürlüğünü artırır. Güvenlik ve gözetim sistemlerinde kamera görüntüsündeki olayların otomatik doğal dil raporlaması operatör yükünü azaltır. Tıbbi görüntülemede radyoloji görüntülerinin otomatik ön-raporlaması klinisyenlere zaman kazandırır. Sosyal medya platformları, kullanıcı fotoğraflarının içeriğini metin olarak indeksleyerek içerik moderasyonu ve arama iyileştirmesi için kullanır. Türkiye'de e-devlet ve kamu web sitelerinde WCAG uyumu zorunlu hâle geldikçe bu teknoloji kurumsal BT gündemine taşınmaktadır.

Sık Sorulan Sorular

  • check_circle Image captioning ile görsel soru yanıtlama (VQA) arasındaki fark nedir?: Image captioning, görüntünün genel içeriğini serbest biçimde metin olarak açıklar. VQA ise belirli bir soruya görüntüye bakarak kısa yanıt üretir ('Bu kaç kişi?' gibi). Modern modeller (BLIP-2, LLaVA) her iki görevi de aynı mimaride yapabilmektedir.
  • check_circle Türkçe görüntü altyazılama modeli var mı?: Doğrudan Türkçe eğitilmiş özel bir image captioning modeli kısıtlıdır. Ancak LLaVA, Qwen-VL ve BLIP-2 gibi modeller, Türkçe talimatla çalıştırıldığında Türkçe açıklama üretebilir. Çok dilli LLM decoder'lı mimariler bu esnekliği sunar.
  • check_circle CIDEr skoru nasıl yorumlanır?: CIDEr skoru 0'dan başlar, teorik üst sınırı yoktur ama pratikte 1.0-1.5 arası güçlü kabul edilir. MS-COCO test setinde en iyi modeller CIDEr ~1.4-1.5 değerlerine ulaşmaktadır. Skoru artırmak için hem sözcük seçimi hem cümle yapısı referanslarla uyumlu olmalıdır.
  • check_circle Image captioning modelini kendi veri setimle nasıl eğitirim?: Hugging Face'de BLIP ve GIT modellerinin fine-tuning kılavuzları mevcuttur. Eğitim için görüntü-metin çifti CSV/JSON formatında hazırlanır ve transformers kütüphanesiyle fine-tuning yapılır. Veri setinin 1.000+ çift içermesi kalite için önerilir; daha azıyla PEFT/LoRA adaptasyonu denenebilir.
  • check_circle Erişilebilirlik için otomatik alt metin üretimi ne kadar güvenilir?: Modern modeller (BLIP-2, LLaVA) genel sahnelerde %90+ insan değerlendirmesi alır. Ancak ince ayrıntı gerektiren profesyonel içeriklerde (tıbbi görüntü, teknik diyagram, haber fotoğrafı) hâlâ insan denetimi önerilir. Hibrid yaklaşım: model altyazıyı üretir, editör kısa sürede doğrular.