tag bilgi-teorisi

Bu sayfada bilgi-teorisi etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

KL Iraksaması (Kullback-Leibler Divergence — KL Sapması), iki olasılık dağılımı arasındaki farkı ölçen bir bilgi-teorik metriktir. P olasılık dağılımını Q ile yaklaşık olarak ifade etmenin 'maliyetini' — bilgi kaybını — ölçer. Formülü: KL(P‖Q) = Σ P(x) log(P(x)/Q(x)). Değerin sıfır olması iki dağılımın özdeş olduğu anlamına gelir; sıfırdan büyük değerler ise iki dağılımın ne kadar farklılaştığını gösterir. KL iraksaması simetrik değildir: KL(P‖Q) ≠ KL(Q‖P). Bu asimetri farklı kullanım senaryolarını doğurur. 'Forward KL' (P‖Q) modelin gerçek dağılımı küçümsememesini zorlar; 'reverse KL' (Q‖P) ise modeli belirli modlara konsantre etme eğilimindedir. Makine öğrenmesinde KL iraksamasının kritik kullanım alanları şunlardır: Bilgi damıtma (knowledge distillation) kaybı — öğretmen ve öğrenci olasılık dağılımlarının ne kadar farklı olduğunu ölçer. Değişkence otokodlayıcılar (VAE) — gizli uzayın dağılımını Gauss'a yaklaştıran düzenlileştirici terim. RLHF ve PPO — LLM ince ayarı sırasında politikanın referans modelden çok uzaklaşmamasını sağlayan kısıt terimi. Dil modeli değerlendirme — iki modelin token olasılık dağılımlarını karşılaştırmak için.

analytics

KL Divergence (KL Iraksaması (Kullback-Leibler Divergence))

KL Iraksaması (Kullback-Leibler Divergence — KL Sapması), iki olasılık dağılımı arasındaki farkı ölçen bir bilgi-teorik metriktir. P olasılık dağılımını Q ile yaklaşık olarak ifade etmenin 'maliyetini' — bilgi kaybını — ölçer. Formülü: KL(P‖Q) = Σ P(x) log(P(x)/Q(x)). Değerin sıfır olması iki dağılımın özdeş olduğu anlamına gelir; sıfırdan büyük değerler ise iki dağılımın ne kadar farklılaştığını gösterir. KL iraksaması simetrik değildir: KL(P‖Q) ≠ KL(Q‖P). Bu asimetri farklı kullanım senaryolarını doğurur. 'Forward KL' (P‖Q) modelin gerçek dağılımı küçümsememesini zorlar; 'reverse KL' (Q‖P) ise modeli belirli modlara konsantre etme eğilimindedir. Makine öğrenmesinde KL iraksamasının kritik kullanım alanları şunlardır: Bilgi damıtma (knowledge distillation) kaybı — öğretmen ve öğrenci olasılık dağılımlarının ne kadar farklı olduğunu ölçer. Değişkence otokodlayıcılar (VAE) — gizli uzayın dağılımını Gauss'a yaklaştıran düzenlileştirici terim. RLHF ve PPO — LLM ince ayarı sırasında politikanın referans modelden çok uzaklaşmamasını sağlayan kısıt terimi. Dil modeli değerlendirme — iki modelin token olasılık dağılımlarını karşılaştırmak için.

arrow_forward
code_blocks

Cross-Entropy (Çapraz Entropi)

Çapraz Entropi (Cross-Entropy), sınıflandırma görevlerinde derin öğrenme modellerinin eğitiminde kullanılan en yaygın kayıp fonksiyonudur. Bilgi teorisinden türetilen bu metrik, modelin ürettiği olasılık dağılımının gerçek etiket dağılımıyla ne kadar uyuştuğunu ölçer; fark büyüdükçe kayıp artar ve model parametrelerini güncellemek için daha güçlü bir gradyan sinyali üretilir. Matematikte entropi, bir olayın ne kadar "sürpriz" olduğunu ölçer: nadir olaylar yüksek, yaygın olaylar düşük bilgi içerir. Çapraz entropi ise iki dağılım arasındaki bilgi kaybını ölçer. İkili sınıflandırma (binary classification) için formül: L = −[y·log(ŷ) + (1−y)·log(1−ŷ)]. Burada y gerçek etiket (0 veya 1), ŷ modelin tahmin ettiği olasılıktır. Model yanlış sınıf için yüksek olasılık verdiğinde log terimi sonsuz büyüklüğe yaklaşarak kayıp patlar; bu matematiksel baskı modeli doğru sınıfa yönlendirir. Çok sınıflı sınıflandırma (multi-class) için kategorik çapraz entropi kullanılır: L = −Σ yᵢ·log(ŷᵢ). Doğru sınıfa karşılık gelen terim dışındaki tüm yᵢ değerleri 0 olduğundan, kayıp yalnızca gerçek sınıfın tahmin olasılığına bağlıdır. Softmax aktivasyonu ile birlikte doğal bir eşleşme oluşturur: softmax çıktıları toplamı 1 olan olasılık dağılımı üretir, çapraz entropi bu dağılımla gerçek etiketi karşılaştırır. Çapraz entropi, ortalama karesel hata (MSE) yerine sınıflandırmada neden tercih edilir? MSE, olasılık tahminleri için zayıf gradyanlar üretir: model doğru etikete 0.9 olasılık verirken yanlış yönde ilerlese bile MSE gradyanı küçük kalır. Çapraz entropi ise logaritmik yapısı sayesinde yanlış sınıflara yüksek olasılık veren kötü tahminleri çok daha sert cezalandırır. Eğitimde dikkat edilmesi gereken bir nokta sayısal kararlılıktır: log(0) tanımsızdır. PyTorch ve TensorFlow gibi kütüphaneler log hesaplamasını softmax ile birleştirerek (log-sum-exp trick) bu problemi çözer; `nn.CrossEntropyLoss()` PyTorch'ta softmax + log + NLL kaybını tek adımda uygular. **Label smoothing**, gerçek etiketleri yumuşatarak (ör. 1.0 yerine 0.9, 0.0 yerine 0.1) aşırı güveni önleyen bir çapraz entropi varyantıdır. Model çok eminleştiğinde genelleme kapasitesi düşer; label smoothing bunu hafifletir ve modern transformerların eğitiminde standart hale gelmiştir.

arrow_forward