Visual Question Answering (Görsel Soru Yanıtlama)
Bir yapay zeka sisteminin görüntü ve doğal dil sorusunu birleştirerek metin tabanlı yanıt ürettiği çok modaliteli görev.
Visual Question Answering (VQA), bir yapay zeka sisteminin bir görüntü ve doğal dilde yazılmış bir soru alarak metin tabanlı yanıt ürettiği çok modaliteli (multimodal) yapay zeka görevidir. Bilgisayarlı görü (Computer Vision) ile doğal dil işlemenin (NLP) kesişiminde yer alan VQA, makinelerin görsel dünyayı anlamasını ve bu anlayışı dil aracılığıyla ifade etmesini gerektirir. Bir VQA sistemi üç temel bileşenden oluşur: görsel özellik çıkarıcı (vision encoder), dil modeli (text encoder) ve füzyon mekanizması. Görsel encoder — başlangıçta konvolüsyonel sinir ağları (CNN), günümüzde ise Vision Transformer (ViT) mimarileri — giriş görüntüsünü yüksek boyutlu özellik vektörlerine dönüştürür. Metin encoder ise soruyu token dizisine çevirir. Füzyon katmanı, çapraz dikkat (cross-attention) mekanizmasıyla iki modalite arasında bağlantı kurar; böylece model soruyla ilgili görüntü bölgelerine odaklanarak yanıt üretir. VQA'nın pratik uygulamaları geniş bir yelpazeye yayılır. Tıbbi görüntülemede radyoloji raporlarının otomasyonunda kullanılır; 'Bu BT görüntüsünde tümör var mı?' gibi sorulara yanıt üretebilir. Görsel engelli kullanıcılar için erişilebilirlik araçlarında, müze ve kültürel miras sitelerinde interaktif rehberlik sistemlerinde, otonom araçların çevre anlama modüllerinde ve endüstriyel görsel denetimde (kalite kontrol) da yaygın biçimde yer almaktadır. Öne çıkan VQA modelleri şunlardır: Salesforce'un BLIP ve BLIP-2 modelleri (129 milyon görüntü-metin çiftiyle önceden eğitildi), Meta'nın açık ağırlıklı LLaVA serisi, OpenAI'nin GPT-4o/GPT-4V modelleri ve Google'ın Gemini Vision ailesi. 2023-2026 yılları arasında bu modeller VQA2.0, GQA ve OK-VQA kıyaslama veri setlerinde insana yakın doğruluk oranlarına ulaşmış; bilgi tabanlı VQA (knowledge-based VQA), matematiksel akıl yürütme (MathVQA) ve tıbbi VQA gibi özelleşmiş alt alanlarda yeni değerlendirme serileri geliştirilmiştir. VQA'nın en kritik zorluğu dil önkestirimidir (language priors): modeller görüntüyü gerçekten analiz etmek yerine dil istatistiklerinden yanıt üretebilir; 'Gökyüzü hangi renk?' sorusuna görüntüye bakmaksızın 'mavi' yanıtı verebilir. Modern çözümler arasında Chain-of-Thought akıl yürütme, veri artırma teknikleri ve çoklu adım dikkat (multi-hop attention) mekanizmaları öne çıkar. Türkiye'deki kullanım senaryolarında VQA, sağlık, turizm ve e-ticaret sektörlerinde görüntü tabanlı arama ve erişilebilirlik çözümlerine entegre edilmektedir.