Kayıp Fonksiyonu Neden Bu Kadar Önemlidir?
Eğitim süreci temelde bir optimizasyon problemidir: ağırlıkları öyle ayarla ki kayıp minimum olsun. Seçilen kayıp fonksiyonu, optimizasyon yüzeyinin şeklini belirler ve model neyi "iyi tahmin" olarak kabul edeceğini buradan öğrenir. Yanlış kayıp seçimi, doğru mimaride bile vasat sonuçlar üretir. Örneğin dengesiz sınıflandırmada doğruluk yerine odak kaybı (focal loss) kullanmak modeli nadiren gözlemlenen sınıfa yönlendirir.
Çapraz Entropi ve Olasılık
Çapraz entropi kaybı, modelin gerçek etiketin olasılığına verdiği skoru log ölçeğinde cezalandırır. Doğru sınıfa yüksek olasılık veren tahminler çok az kayıp üretir; düşük olasılık veren tahminler ise orantısız yüksek kayıp üretir. Bu asimetri, modeli güvenilir ve iyi kalibre edilmiş olasılık çıktıları üretmeye iter.
Regresyon Kayıpları: MSE vs MAE
MSE büyük hataları karesiyle cezalandırır, bu nedenle aykırı değerlere karşı çok duyarlıdır. Eğitim verisinde aykırı değerler varsa MSE modeli bu örneklere odaklanmaya iter ve genel performans bozulabilir. MAE bu örneklere daha az ağırlık verir ama gradyanları sabittir ve yakınsama yavaşlayabilir. Huber kaybı küçük hatalarda MSE, büyük hatalarda MAE davranışını birleştirir.
Düzenlileştirme ile Kayıp Genişletme
Toplam kayıp genellikle görev kaybı artı düzenlileştirme terimi olarak yazılır. L2 düzenlileştirmesi ağırlıkların karelerinin toplamını ceza olarak ekler; bu ağırlıkları sıfıra yaklaştırır ama tam sıfır yapmaz. L1 düzenlileştirmesi ağırlıkların mutlak değerlerini kullanır; bazı ağırlıkları tam sıfır yaparak seyrek modeller üretir. Lambda hiperparametresi bu dengeyi kontrol eder.
📉 Kayıp Fonksiyonu Seçim Rehberi
- check_circle İkili sınıflandırma: Binary Cross-Entropy; sigmoid çıkışlı modeller için standart seçim
- check_circle Çok sınıflı sınıflandırma: Categorical Cross-Entropy; softmax ile birlikte kullanılır
- check_circle Regresyon: MSE aykırı değerlere duyarlıysa, MAE veya Huber kaybı daha sağlamdır
- check_circle Sıralama görevleri: Triplet veya Contrastive loss; gömü öğrenmesinde mesafeyi şekillendirir
- check_circle Dil modellemesi: Cross-entropy next-token tahmini için evrensel standarttır
Sıkça Sorulan Sorular
- check_circle Kayıp fonksiyonu ile maliyet fonksiyonu aynı şey midir? Terminoloji değişebilir: kayıp genellikle tek örnek için, maliyet ise tüm veri seti için hesaplanan ortalama hatayı ifade eder. Pratikte çoğu çerçeve bu terimleri birbirinin yerine kullanır.
- check_circle Negatif kayıp değeri mümkün müdür? Standart kayıp fonksiyonları (cross-entropy, MSE) her zaman sıfır veya pozitif değer üretir. Ancak bazı özel formülasyonlarda (örneğin ELBO) negatif değer teorik olarak mümkündür.
- check_circle Hangi kayıp fonksiyonu seçmeliyim? Görev türü ve veri dağılımına bakın. İkili sınıflandırma için binary cross-entropy, regresyon için MSE başlangıç noktasıdır. Dengesiz sınıflar için focal loss, aykırı değer barındıran regresyon için Huber tercih edilir.
- check_circle Kayıp sıfıra ulaşabilir mi? Eğitim verisini ezberleyen aşırı derin bir model eğitim kaybını sıfıra yaklaştırabilir; ancak bu overfitting'e işaret eder. Test kaybına da bakılmadan erken başarı ilan edilmemelidir.