Positional Encoding (Konum Kodlama (Positional Encoding))
Transformer modellerinde token'ların dizi içindeki sıralarını temsil etmek için embedding vektörlerine eklenen sayısal kodlama yöntemi.
Konum Kodlama (Positional Encoding), Transformer mimarisinin temel bileşenlerinden biridir. Geleneksel Tekrarlayan Sinir Ağları (RNN) ve LSTM modelleri token'ları sırayla işleyerek doğal olarak konum bilgisini korur; Transformer modelleri ise tüm token'ları aynı anda paralel biçimde işler. Bu yaklaşım hesapsal açıdan büyük bir avantaj sunarken, modelin dizideki sıra bilgisini doğrudan elde edememesi anlamına gelir. Konum kodlama bu sorunu çözer: her token'ın öğrenilmiş embedding vektörüne, o token'ın dizideki konumunu temsil eden sayısal bir vektör eklenir. Örneğin "Kedi fareyi kovaladı" cümlesinde "kedi" kelimesi 1. konumda, "fareyi" 2. konumda yer alır; bu iki konumun farklı konum vektörleri sayesinde model sözcüklerin sıralamasını anlayabilir. Sinüzoidal Konum Kodlama, orijinal "Attention Is All You Need" makalesinde (Vaswani ve diğerleri, 2017) kullanılmış yöntemdir. Bu yaklaşımda her konum için sinüs ve kosinüs fonksiyonları hesaplanır: PE(pos, 2i) = sin(pos / 10000^(2i/d)) ve PE(pos, 2i+1) = cos(pos / 10000^(2i/d)). Farklı frekanstaki dalgalar sayesinde her konum benzersiz bir imzaya sahip olur; bu vektörler öğrenilmez, eğitim sırasında sabit kalır. BERT ve GPT-2 gibi modeller, konum bilgisini eğitim sırasında veri üzerinden öğrenir. Bu öğrenilmiş konum gömmeleri daha esnek bir yapı sunmakla birlikte eğitimde görülmemiş dizi uzunluklarına genelleme yapmakta zorlanabilir. RoPE (Rotary Position Embedding), LLaMA, Mistral, Gemma ve Qwen ailesi gibi modern dil modellerinin büyük çoğunluğunun tercih ettiği bir yöntemdir. RoPE, konum bilgisini döndürme matrisleri aracılığıyla dikkat mekanizmasına doğrudan entegre eder. Hem mutlak hem göreli konum bilgisini etkin biçimde kodlar; uzun bağlam uzunluklarına genelleme konusunda önceki yöntemlere kıyasla belirgin üstünlük gösterir. ALiBi (Attention with Linear Biases) ise dikkat puanlarına konum farkına dayalı doğrusal bir ceza ekler. Bu tasarım, modeli eğitimde hiç görmediği dizi uzunluklarına genellemeye yardımcı olur ve bellek açısından verimli bir çözüm sunar. Konum kodlamasının seçimi modelin bağlam penceresi boyutunu, çok dilli performansını ve hesapsal verimini doğrudan etkiler. Bu nedenle büyük dil modeli araştırmalarında, özellikle uzun bağlam penceresi geliştirme çalışmalarında, aktif olarak araştırılan bir alan olmayı sürdürmektedir.