tag CrossAttention
Bu sayfada CrossAttention etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Cross-Attention (Çapraz Dikkat Mekanizması), 2017 yılında Google Brain ekibinin "Attention is All You Need" makalesiyle tanıttığı Transformer mimarisinin temel bileşenlerinden biridir. Self-Attention'dan farklı olarak iki ayrı dizinin birbirine dikkat etmesini sağlar: sorgu (Query) vektörleri alıcı diziden, anahtar (Key) ve değer (Value) vektörleri ise bağlam dizisinden üretilir. Matematiksel formülü self-attention ile aynı çekirdeği paylaşır: Attention(Q, K, V) = softmax(QK^T / √d_k) · V. Ancak Q, K ve V üç ayrı kaynaktan türetilir. Boyutsal ölçekleme faktörü √d_k, nokta çarpım değerlerinin patlamasını önler; gradyanlar bu yolla kararlı kalır. Orijinal Transformer mimarisinde cross-attention, kodlayıcı-kod çözücü (encoder-decoder) yapısında çalışır: kod çözücü katmanları Q vektörlerini kendi çıktısından üretirken K ve V vektörlerini kodlayıcının son katman çıktısından alır. Makine çevirisinde bu yapı, hedef dildeki her kelimenin kaynak dildeki tüm kelimelerle dinamik bağlantı kurmasını sağlar; model neye dikkat etmesi gerektiğini bağlama göre öğrenir. 2020'lerin başından itibaren cross-attention, metin-görüntü modellerinde kritik bir rol üstlendi. Stable Diffusion ve DALL-E gibi difüzyon modellerinde metin gömme vektörleri K ve V olarak kullanılırken görüntü gizil uzayındaki temsiller Q vektörü sağlar. Bu çapraz bağlantı aracılığıyla "gece yarısı şehrinde neon ışıklı bir kedi" gibi bir metin açıklaması ilgili görsel bölgelerle eşleştirilir. 2025-2026 döneminde çok modlu büyük dil modelleri (GPT-4o, Gemini 2.0, Claude 3.5 Sonnet), cross-attention mekanizmalarını ses, görüntü ve metin gibi farklı modaliteleri tek bir model içinde birleştirmek için genişletti. Flash Attention 3 ve Grouped Query Attention (GQA) gibi verimlilik teknikleri, uzun bağlamlarda cross-attention hesaplama maliyetini önemli ölçüde düşürdü. LoRA gibi parametre-verimli ince ayar yöntemleri de çoğunlukla cross-attention katmanlarındaki Q ve V matrislerini hedefleyerek model uyarlamasını yapar.