tag konum-kodlama

Bu sayfada konum-kodlama etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

RoPE (Rotary Position Embedding — Dönel Konum Kodlama), transformer tabanlı dil modellerinde token konumlarını temsil etmek için 2021 yılında Jianlin Su ve ekibi tarafından önerilen özgün bir konum kodlama yöntemidir. Geleneksel mutlak konum gömme yaklaşımlarının (sinüs/kosinüs PE veya öğrenilmiş vektörler) yetersiz kaldığı bağlam uzunluğu genellenebilirliği sorununu zarif biçimde çözer. Temel fikir, her tokenın sorgu (query) ve anahtar (key) vektörlerini, o tokenın sekans içindeki konumuna bağlı bir açıyla karmaşık sayı uzayında döndürmektir. Böylece iki token arasındaki dikkat puanı (dot product), yalnızca konumlar arasındaki farka (m−n) bağlı hale gelir; modelin öğrenmesi gereken göreli konum bilgisi, dikkat hesaplamasına doğal olarak yerleşmiş olur. Matematiksel olarak d-boyutlu vektör, d/2 adet iki boyutlu alt uzaya ayrılır. Her alt uzay için farklı bir taban frekans θ_i = 10000^(−2i/d) kullanılır. Yüksek frekanslı boyutlar yakın komşuluk ilişkilerini, düşük frekanslı boyutlar uzun menzilli yapısal bağları kodlar. Bu çok ölçekli yapı, hem kısa sözcüksel hem de uzun sözdizimsel örüntüleri bir arada temsil eder ve dikkat mekanizmasına yönelik uzaklık yatırılabilirliği (distance invariance) özelliği kazandırır. RoPE'un pratik avantajları önemlidir: ekstra parametre gerektirmez; göreli konum farkındalığı sinüs PE'ye göre çok daha güçlüdür; bağlam uzunluğu genişletmesi (YaRN, NTK scaling, LongRoPE gibi yöntemler) ile eğitim penceresinin 4 ila 128 katına çıkılabilir. Flash Attention gibi bellek verimli kernel'larla tam uyumludur ve hesaplama maliyeti ihmal edilebilir düzeyde kalır. Meta'nın LLaMA serisi (1, 2, 3), Mistral, Gemma (Google DeepMind), Qwen (Alibaba), DeepSeek ve Falcon gibi modern açık kaynaklı dil modelleri RoPE'u standart konum kodlaması olarak benimsemiştir. Bu yaygın kullanımın arkasında RoPE'un matematiksel sağlamlığı, uygulanmasının kolaylığı ve bağlam uzatmada gösterdiği üstün esneklik yatar. Günümüzde RoPE, açık kaynak LLM ekosisteminin fiili standardı konumundadır.

rotate_right

RoPE (Dönel Konum Kodlama)

RoPE (Rotary Position Embedding — Dönel Konum Kodlama), transformer tabanlı dil modellerinde token konumlarını temsil etmek için 2021 yılında Jianlin Su ve ekibi tarafından önerilen özgün bir konum kodlama yöntemidir. Geleneksel mutlak konum gömme yaklaşımlarının (sinüs/kosinüs PE veya öğrenilmiş vektörler) yetersiz kaldığı bağlam uzunluğu genellenebilirliği sorununu zarif biçimde çözer. Temel fikir, her tokenın sorgu (query) ve anahtar (key) vektörlerini, o tokenın sekans içindeki konumuna bağlı bir açıyla karmaşık sayı uzayında döndürmektir. Böylece iki token arasındaki dikkat puanı (dot product), yalnızca konumlar arasındaki farka (m−n) bağlı hale gelir; modelin öğrenmesi gereken göreli konum bilgisi, dikkat hesaplamasına doğal olarak yerleşmiş olur. Matematiksel olarak d-boyutlu vektör, d/2 adet iki boyutlu alt uzaya ayrılır. Her alt uzay için farklı bir taban frekans θ_i = 10000^(−2i/d) kullanılır. Yüksek frekanslı boyutlar yakın komşuluk ilişkilerini, düşük frekanslı boyutlar uzun menzilli yapısal bağları kodlar. Bu çok ölçekli yapı, hem kısa sözcüksel hem de uzun sözdizimsel örüntüleri bir arada temsil eder ve dikkat mekanizmasına yönelik uzaklık yatırılabilirliği (distance invariance) özelliği kazandırır. RoPE'un pratik avantajları önemlidir: ekstra parametre gerektirmez; göreli konum farkındalığı sinüs PE'ye göre çok daha güçlüdür; bağlam uzunluğu genişletmesi (YaRN, NTK scaling, LongRoPE gibi yöntemler) ile eğitim penceresinin 4 ila 128 katına çıkılabilir. Flash Attention gibi bellek verimli kernel'larla tam uyumludur ve hesaplama maliyeti ihmal edilebilir düzeyde kalır. Meta'nın LLaMA serisi (1, 2, 3), Mistral, Gemma (Google DeepMind), Qwen (Alibaba), DeepSeek ve Falcon gibi modern açık kaynaklı dil modelleri RoPE'u standart konum kodlaması olarak benimsemiştir. Bu yaygın kullanımın arkasında RoPE'un matematiksel sağlamlığı, uygulanmasının kolaylığı ve bağlam uzatmada gösterdiği üstün esneklik yatar. Günümüzde RoPE, açık kaynak LLM ekosisteminin fiili standardı konumundadır.

arrow_forward
code_blocks

Positional Encoding (Konum Kodlama (Positional Encoding))

Konum Kodlama (Positional Encoding), Transformer mimarisinin temel bileşenlerinden biridir. Geleneksel Tekrarlayan Sinir Ağları (RNN) ve LSTM modelleri token'ları sırayla işleyerek doğal olarak konum bilgisini korur; Transformer modelleri ise tüm token'ları aynı anda paralel biçimde işler. Bu yaklaşım hesapsal açıdan büyük bir avantaj sunarken, modelin dizideki sıra bilgisini doğrudan elde edememesi anlamına gelir. Konum kodlama bu sorunu çözer: her token'ın öğrenilmiş embedding vektörüne, o token'ın dizideki konumunu temsil eden sayısal bir vektör eklenir. Örneğin "Kedi fareyi kovaladı" cümlesinde "kedi" kelimesi 1. konumda, "fareyi" 2. konumda yer alır; bu iki konumun farklı konum vektörleri sayesinde model sözcüklerin sıralamasını anlayabilir. Sinüzoidal Konum Kodlama, orijinal "Attention Is All You Need" makalesinde (Vaswani ve diğerleri, 2017) kullanılmış yöntemdir. Bu yaklaşımda her konum için sinüs ve kosinüs fonksiyonları hesaplanır: PE(pos, 2i) = sin(pos / 10000^(2i/d)) ve PE(pos, 2i+1) = cos(pos / 10000^(2i/d)). Farklı frekanstaki dalgalar sayesinde her konum benzersiz bir imzaya sahip olur; bu vektörler öğrenilmez, eğitim sırasında sabit kalır. BERT ve GPT-2 gibi modeller, konum bilgisini eğitim sırasında veri üzerinden öğrenir. Bu öğrenilmiş konum gömmeleri daha esnek bir yapı sunmakla birlikte eğitimde görülmemiş dizi uzunluklarına genelleme yapmakta zorlanabilir. RoPE (Rotary Position Embedding), LLaMA, Mistral, Gemma ve Qwen ailesi gibi modern dil modellerinin büyük çoğunluğunun tercih ettiği bir yöntemdir. RoPE, konum bilgisini döndürme matrisleri aracılığıyla dikkat mekanizmasına doğrudan entegre eder. Hem mutlak hem göreli konum bilgisini etkin biçimde kodlar; uzun bağlam uzunluklarına genelleme konusunda önceki yöntemlere kıyasla belirgin üstünlük gösterir. ALiBi (Attention with Linear Biases) ise dikkat puanlarına konum farkına dayalı doğrusal bir ceza ekler. Bu tasarım, modeli eğitimde hiç görmediği dizi uzunluklarına genellemeye yardımcı olur ve bellek açısından verimli bir çözüm sunar. Konum kodlamasının seçimi modelin bağlam penceresi boyutunu, çok dilli performansını ve hesapsal verimini doğrudan etkiler. Bu nedenle büyük dil modeli araştırmalarında, özellikle uzun bağlam penceresi geliştirme çalışmalarında, aktif olarak araştırılan bir alan olmayı sürdürmektedir.

arrow_forward