KL Iraksamasının Yorumu
code Bilgi Teorisi
P yerine Q varsayarak kodlama yapmanın ekstra bit maliyeti. P'ye uygun bir kod Q için kullanıldığında oluşan verimsizliği ölçer.
warning Mesafe Değil Iraksama
KL simetrik değildir, bu nedenle mesafe (metrik) değildir. Üçgen eşitsizliğini sağlamaz. Jensen-Shannon Iraksaması (JSD) simetrik bir alternatiftir.
psychology RLHF'deki Rolü
PPO tabanlı RLHF'de KL ceza terimi, politika modelinin referans LLM'den çok uzaklaşmasını engeller; iyi dili korurken ödülü maksimize eder.
filter_alt Damıtmada KL Iraksaması
Bilgi damıtmasında toplam kayıp genellikle şöyle yazılır: L = α × CE(y, öğrenci_çıktı) + (1-α) × KL(öğretmen‖öğrenci) × T². Burada T sıcaklık parametresidir; yumuşak etiketlerin düzleştirilmesini sağlar. α katsayısı sert etiket (gerçek hedef) ile yumuşak etiket (öğretmen olasılıkları) kaybı arasındaki dengeyi ayarlar. T² terimi sıcaklık ölçeklemesinin gradyan büyüklüğünü telafi eder.
KL Iraksamasının Kullanım Alanları
- check_circle RLHF ve DPO: Politika modelinin referans modelden çok fazla uzaklaşmamasını sağlayan düzenleyici terim. KL cezası dil tutarlılığını korur; ödülü maksimize etmek için modelin tamamen farklılaşmasını önler.
- check_circle Bilgi Damıtma: Öğrenci modelin çıkış dağılımının öğretmen dağılımına yakınlığını ölçer. KL kaybının minimizasyonu öğrenci-öğretmen uyumu sağlar.
- check_circle Değişken Otoenkoder (VAE): Gizli uzayın standart normal dağılıma yakın olmasını zorunlu kılan düzenleyici kayıp. KL cezası gizli temsili düzenli tutar.
- check_circle Dağılım Kayması (Distribution Shift) Tespiti: Üretim veri dağılımının eğitim verisinden sapmasını izlemek için KL ıraksama metrik olarak kullanılabilir.
- check_circle Bayesian Çıkarım: ELBO (Evidence Lower Bound) optimizasyonunda posterior dağılımın prior'a yakınlığını ölçen terim.
KL Iraksamasının Matematiksel Temeli ve Simetri Sorunu
KL ıraksama (Kullback-Leibler Divergence), iki olasılık dağılımı P ve Q arasındaki farkı ölçer: KL(P||Q) = Σ P(x) log(P(x)/Q(x)). Önemli bir özellik: KL ıraksama simetrik değildir — KL(P||Q) ≠ KL(Q||P). Bu asimetri pratikte önemlidir: KL(P||Q) Q'nun sıfır olduğu yerlerde P'nin büyük değer almasına izin vermez (sıfır kaçınma — zero avoiding); KL(Q||P) ise P'nin sıfır olduğu yerlerde Q'nun büyük olmasına izin vermez (sıfır zorlama — zero forcing). Bu iki yön farklı optimizasyon davranışlarına yol açar. Simetrik alternatifler: Jensen-Shannon ıraksama (JSD) ve Wasserstein mesafesi KL'nin simetrik versiyonları veya alternatifleri olarak kullanılabilir. RLHF bağlamında KL cezasının pratik etkisi şöyledir: β (beta) çarpanı küçüldükçe model ödülü özgürce optimize eder ama referanstan uzaklaşır; β büyüdükçe model referansa yakın kalır ama ödül optimizasyonu kısıtlanır. Bu denge, modelin hem güvenli hem performanslı kalmasını sağlar.
quiz Sık Sorulan Sorular
- check_circle KL iraksaması neden asimetriktir?: P(x) > 0 olduğu halde Q(x) = 0 olan noktalar KL(P‖Q)'yi sonsuz yapar; tersi geçerli değildir. Bu asimetri hangi dağılımın "referans" alındığına göre farklı optimizasyon davranışları doğurur.
- check_circle Jensen-Shannon Iraksaması ne zaman tercih edilir?: Simetrik bir ölçüm gerektiğinde; ör. iki dağılımı karşılaştırmak için referans/yaklaşım ayrımı önemli değilse. JSD her zaman sonlu bir değer verir ve [0,1] aralığındadır (JSD = ½KL(P‖M) + ½KL(Q‖M), M = (P+Q)/2).
- check_circle KL ıraksama nedir?: İki olasılık dağılımı arasındaki farkı ölçen matematiksel metriktir. KL(P||Q), Q yerine P kullanılırken kaybedilen bilgi miktarını ifade eder. RLHF, VAE ve bilgi damıtmada düzenleyici terim olarak kullanılır.
- check_circle KL ıraksama neden RLHF'de kullanılır?: Politika modelinin referans (orijinal) modelden çok farklılaşmasını önlemek için. KL cezası olmadan model ödülü maksimize etmek adına dili bozabilir veya saldırgan çıktılar üretebilir.
- check_circle KL ıraksama simetrik midir?: Hayır. KL(P||Q) ≠ KL(Q||P). Bu asimetri hangi dağılımı referans alacağınızı etkiler. Simetrik alternatif olarak Jensen-Shannon Divergence (JSD) kullanılabilir.
- check_circle KL ıraksama ile cross-entropy arasındaki fark nedir?: KL(P||Q) = H(P,Q) - H(P). Cross-entropy H(P,Q) KL ıraksama artı P'nin entropisidir. P sabit iken (eğitim etiketleri gibi) H(P) sabit olduğundan cross-entropy minimizasyonu KL minimizasyonuna eşdeğerdir.