tag SpeculativeDecoding
Bu sayfada SpeculativeDecoding etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Speculative Decoding (Spekülatif Kod Çözme), büyük dil modellerinin (LLM) otoregresif çıkarım hızını artırmak için tasarlanmış lossless bir optimizasyon tekniğidir. Klasik otoregresif çıkarımda her token, hedef modelin (target model) tek bir ileri geçişini (forward pass) gerektirir; bu süreç GPU'nun hesap kapasitesini tam verimde kullanmaz ve bellek bant genişliği darboğazına yol açar. Speculative decoding bu sorunu iki model mimarisiyle çözer: küçük, hızlı bir taslak model (draft model) ve büyük, kaliteli bir hedef model. Her adımda taslak model γ token önerir (genellikle γ = 4–8). Hedef model bu γ tokeni tek bir toplu ileri geçişte paralel olarak doğrular; yani γ+1 token için gereken hesaplama maliyeti, tek token üretme maliyetiyle yaklaşık eşittir. Spekülatif örnekleme (speculative sampling) kuralı, her tokenin hedef modelin olasılık dağılımıyla uyumluluk olasılığına göre kabul veya reddedilmesini belirler. İlk ret noktasından itibaren hedef modelin kendi tahminleri devreye girer. Bu prosedür, hedef modelin doğrudan örneklemesiyle istatistiksel olarak özdeş bir çıktı dağılımı üretir; dolayısıyla lossless bir hızlanmadır. Gerçek uygulamalarda hız kazanımı, taslak modelin kabul oranına (acceptance rate) bağlıdır. Kod tamamlama ve formüllü metinler gibi düşük entropili çıktılarda kabul oranı %80–90'a ulaşabilir ve 2×–4× duvar saati hızlanması gözlemlenir. Buna karşın yüksek entropi gerektiren yaratıcı metinlerde kazanım azalır. Tekniğin çeşitli biçimleri geliştirilmiştir. Medusa, hedef modele ek taslak başları (heads) ekleyerek ayrı bir draft modeline olan ihtiyacı ortadan kaldırır. EAGLE ve EAGLE-2, gizli katman aktivasyonlarından beslenen tek katmanlı ağ yapısıyla çok yüksek kabul oranları elde eder. Self-speculative yöntemler ise hedef modelin erken çıkış katmanlarını taslak olarak kullanır; bu sayede ikinci bir modele gerek kalmaz. Üretim ortamında Google Gemini, Anthropic Claude, vLLM ve SGLang speculative decoding'i aktif biçimde kullanmaktadır. Gerçek zamanlı sohbet asistanları ve anlık kod tamamlama araçları, düşük gecikme gereksinimi nedeniyle bu teknikten en fazla kazanım elde eden uygulama alanlarıdır.