Görsel Dil Modeli
Görüntü ve metin modalitelerini birleştirerek görsel içerik anlama ve açıklama üretebilen çok modlu yapay zeka modeli.
Görsel Dil Modeli (Vision Language Model — VLM), görüntü ve metin gibi farklı modaliteleri tek bir sinir ağı içinde birleştirerek hem görsel hem dilsel bilgiyi anlayıp üretebilen çok modlu (multimodal) yapay zeka modelidir. Geleneksel dil modelleri yalnızca metni işlerken VLM'ler bir fotoğraftaki nesneyi tanımlayabilir, grafik ve tabloları yorumlayabilir, belge görsellerinden bilgi çıkarabilir ya da görsel içeriklere dayalı sorulara yanıt verebilir. VLM mimarisinin temel bileşenleri üç katmandan oluşur. Görsel kodlayıcı (visual encoder): ViT (Vision Transformer) gibi bir model, ham piksel verisini yüksek boyutlu gömme vektörlerine dönüştürür. Bağlantı katmanı (connector/projector): CLIP, LLaVA tarzı MLP veya Q-Former gibi yapılar görsel gömmeleri dil modelinin token uzayına projeksiyonlar. Dil modeli omurgası: Görsel ve metin token'larını birlikte işleyen büyük bir Transformer, bağlamsal anlam oluşturur ve metin çıktısı üretir. Bu üç adımlı yapı, modelin bir resme bakarak "Bu görüntüde ne görüyorsun?" sorusuna ayrıntılı Türkçe yanıt vermesini mümkün kılar. Öne çıkan VLM'ler arasında GPT-4 Vision (OpenAI), Claude 3 Sonnet/Opus (Anthropic), Gemini Pro Vision (Google) ve açık kaynak alternatifleri LLaVA, Idefics, MiniGPT-4 ve Qwen-VL sayılabilir. Bu modeller görüntü açıklama (image captioning), görsel soru yanıtlama (VQA), belge anlama (document understanding), grafik yorumlama ve tıbbi görüntü analizi gibi görevlerde kullanılmaktadır. Değerlendirme kıyaslamaları arasında VQAv2 (görsel soru yanıtlama), MMBench (çok modlu dil anlama), MMMU (üniversite düzeyi görsel anlama) ve TextVQA (metin içeren görüntülerde soru yanıtlama) yer almaktadır. 2025–2026 döneminde VLM araştırmaları video anlama, gerçek zamanlı akış işleme ve çok adımlı görsel akıl yürütme üzerine yoğunlaşmaktadır. Türk sağlık, eğitim ve e-ticaret sektörleri için Türkçe açıklama üretebilen VLM uygulamaları giderek önem kazanmaktadır.