KL Divergence (KL Iraksaması (Kullback-Leibler Divergence))

İki olasılık dağılımı arasındaki bilgi kaybını ölçen asimetrik metrik; VAE, RLHF ve bilgi damıtmasının temel kayıp fonksiyonu bileşeni.

KL Iraksaması (Kullback-Leibler Divergence — KL Sapması), iki olasılık dağılımı arasındaki farkı ölçen bir bilgi-teorik metriktir. P olasılık dağılımını Q ile yaklaşık olarak ifade etmenin "maliyetini" — bilgi kaybını — ölçer. Formülü: KL(P‖Q) = Σ P(x) log(P(x)/Q(x)). Değerin sıfır olması iki dağılımın özdeş olduğu anlamına gelir; sıfırdan büyük değerler ise iki dağılımın ne kadar farklılaştığını gösterir. Solomon Kullback ve Richard Leibler metriği 1951'de "On Information and Sufficiency" başlıklı çalışmalarında bilgi teorisi çerçevesinde türettiler. Shannon entropisinin bir uzantısıdır: H(P,Q) = H(P) + KL(P‖Q); yani çapraz entropi, özsel entropinin ve KL ıraksama teriminin toplamıdır. KL iraksaması simetrik değildir: KL(P‖Q) ≠ KL(Q‖P). Bu asimetri farklı kullanım senaryolarını doğurur. "Forward KL" (P‖Q) modelin gerçek dağılımı P'yi küçümsememesini zorlar; kütle kaplayan (mean-seeking) bir yaklaşım üretir ve tüm modları kapsayan geniş bir tahmin tercih edilir. "Reverse KL" (Q‖P) ise belirli modlara konsantre olma eğilimindedir ve mod-arayan (mode-seeking) davranış sergiler; değişkence Bayes ve ELBO optimizasyonu bu yönü kullanır. Makine öğrenmesinde KL iraksamasının kritik kullanım alanları şunlardır: Bilgi damıtmada öğretmen ve öğrenci modelin olasılık dağılımları arasındaki KL kaybı, ham etiket bilgisinden çok daha zengin bir eğitim sinyali sunar. Değişkence otokodlayıcılarda (VAE) posterior dağılım q(z|x) ile prior p(z) arasındaki KL terimi, ELBO'nun düzenlileştirici bileşeni olarak gizli uzayı düzenli tutar. RLHF ve PPO'da politika modelinin referans modelden çok uzaklaşmamasını sağlayan KL ceza terimi β çarpanıyla ödül korsanlığını önler. Dağılım kayması tespitinde ise üretim verisinin eğitim dağılımından sapmasını izlemek için başvurulan temel metrik haline gelmiştir. KL her zaman negatif olmayan bir değer üretir — Gibbs eşitsizliği bunu garantiler. Simetri gerektiğinde Jensen-Shannon (JS) iraksaması tercih edilir: JSD(P,Q) = ½ KL(P‖M) + ½ KL(Q‖M), M = (P+Q)/2. JS her zaman sonlu bir değer verir ve [0,1] aralığıyla kısıtlıdır. Pratikte PyTorch'ta torch.nn.KLDivLoss, JAX'ta optax.kl_divergence ve NumPy/SciPy'da scipy.special.rel_entr fonksiyonları ile hesaplanır.

KL Iraksamasının Yorumu

code Bilgi Teorisi

P yerine Q varsayarak kodlama yapmanın ekstra bit maliyeti. P'ye uygun bir kod Q için kullanıldığında oluşan verimsizliği ölçer.

warning Mesafe Değil Iraksama

KL simetrik değildir, bu nedenle mesafe (metrik) değildir. Üçgen eşitsizliğini sağlamaz. Jensen-Shannon Iraksaması (JSD) simetrik bir alternatiftir.

psychology RLHF'deki Rolü

PPO tabanlı RLHF'de KL ceza terimi, politika modelinin referans LLM'den çok uzaklaşmasını engeller; iyi dili korurken ödülü maksimize eder.

filter_alt Damıtmada KL Iraksaması

Bilgi damıtmasında toplam kayıp genellikle şöyle yazılır: L = α × CE(y, öğrenci_çıktı) + (1-α) × KL(öğretmen‖öğrenci) × T². Burada T sıcaklık parametresidir; yumuşak etiketlerin düzleştirilmesini sağlar. α katsayısı sert etiket (gerçek hedef) ile yumuşak etiket (öğretmen olasılıkları) kaybı arasındaki dengeyi ayarlar. T² terimi sıcaklık ölçeklemesinin gradyan büyüklüğünü telafi eder.

KL Iraksamasının Kullanım Alanları

  • check_circle RLHF ve DPO: Politika modelinin referans modelden çok fazla uzaklaşmamasını sağlayan düzenleyici terim. KL cezası dil tutarlılığını korur; ödülü maksimize etmek için modelin tamamen farklılaşmasını önler.
  • check_circle Bilgi Damıtma: Öğrenci modelin çıkış dağılımının öğretmen dağılımına yakınlığını ölçer. KL kaybının minimizasyonu öğrenci-öğretmen uyumu sağlar.
  • check_circle Değişken Otoenkoder (VAE): Gizli uzayın standart normal dağılıma yakın olmasını zorunlu kılan düzenleyici kayıp. KL cezası gizli temsili düzenli tutar.
  • check_circle Dağılım Kayması (Distribution Shift) Tespiti: Üretim veri dağılımının eğitim verisinden sapmasını izlemek için KL ıraksama metrik olarak kullanılabilir.
  • check_circle Bayesian Çıkarım: ELBO (Evidence Lower Bound) optimizasyonunda posterior dağılımın prior'a yakınlığını ölçen terim.

KL Iraksamasının Matematiksel Temeli ve Simetri Sorunu

KL ıraksama (Kullback-Leibler Divergence), iki olasılık dağılımı P ve Q arasındaki farkı ölçer: KL(P||Q) = Σ P(x) log(P(x)/Q(x)). Önemli bir özellik: KL ıraksama simetrik değildir — KL(P||Q) ≠ KL(Q||P). Bu asimetri pratikte önemlidir: KL(P||Q) Q'nun sıfır olduğu yerlerde P'nin büyük değer almasına izin vermez (sıfır kaçınma — zero avoiding); KL(Q||P) ise P'nin sıfır olduğu yerlerde Q'nun büyük olmasına izin vermez (sıfır zorlama — zero forcing). Bu iki yön farklı optimizasyon davranışlarına yol açar. Simetrik alternatifler: Jensen-Shannon ıraksama (JSD) ve Wasserstein mesafesi KL'nin simetrik versiyonları veya alternatifleri olarak kullanılabilir. RLHF bağlamında KL cezasının pratik etkisi şöyledir: β (beta) çarpanı küçüldükçe model ödülü özgürce optimize eder ama referanstan uzaklaşır; β büyüdükçe model referansa yakın kalır ama ödül optimizasyonu kısıtlanır. Bu denge, modelin hem güvenli hem performanslı kalmasını sağlar.

quiz Sık Sorulan Sorular

  • check_circle KL iraksaması neden asimetriktir?: P(x) > 0 olduğu halde Q(x) = 0 olan noktalar KL(P‖Q)'yi sonsuz yapar; tersi geçerli değildir. Bu asimetri hangi dağılımın "referans" alındığına göre farklı optimizasyon davranışları doğurur.
  • check_circle Jensen-Shannon Iraksaması ne zaman tercih edilir?: Simetrik bir ölçüm gerektiğinde; ör. iki dağılımı karşılaştırmak için referans/yaklaşım ayrımı önemli değilse. JSD her zaman sonlu bir değer verir ve [0,1] aralığındadır (JSD = ½KL(P‖M) + ½KL(Q‖M), M = (P+Q)/2).
  • check_circle KL ıraksama nedir?: İki olasılık dağılımı arasındaki farkı ölçen matematiksel metriktir. KL(P||Q), Q yerine P kullanılırken kaybedilen bilgi miktarını ifade eder. RLHF, VAE ve bilgi damıtmada düzenleyici terim olarak kullanılır.
  • check_circle KL ıraksama neden RLHF'de kullanılır?: Politika modelinin referans (orijinal) modelden çok farklılaşmasını önlemek için. KL cezası olmadan model ödülü maksimize etmek adına dili bozabilir veya saldırgan çıktılar üretebilir.
  • check_circle KL ıraksama simetrik midir?: Hayır. KL(P||Q) ≠ KL(Q||P). Bu asimetri hangi dağılımı referans alacağınızı etkiler. Simetrik alternatif olarak Jensen-Shannon Divergence (JSD) kullanılabilir.
  • check_circle KL ıraksama ile cross-entropy arasındaki fark nedir?: KL(P||Q) = H(P,Q) - H(P). Cross-entropy H(P,Q) KL ıraksama artı P'nin entropisidir. P sabit iken (eğitim etiketleri gibi) H(P) sabit olduğundan cross-entropy minimizasyonu KL minimizasyonuna eşdeğerdir.