Underfitting (Eksik Öğrenme)

Modelin eğitim verisindeki örüntüleri kavrayamayacak kadar basit kalması; hem eğitim hem test setlerinde yüksek hata üretmesi durumu.

Underfitting (yetersiz öğrenme), bir makine öğrenmesi modelinin hem eğitim verisini hem de daha önce hiç görmediği test verisini yeterince iyi öğrenemediği durumu ifade eder. Model, verideki temel örüntüleri ve ilişkileri yakalayacak kapasiteden yoksundur; bu nedenle eğitim hatasının kendisi bile kabul edilemez yüksek kalır. Aşırı öğrenme (overfitting) ile karşılaştırıldığında underfitting daha kolay fark edilir: hem eğitim hem de doğrulama kayıpları yüksek seyreder ve ikisi arasında büyük bir uçurum oluşmaz. Yetersiz öğrenmenin kökeninde çoğunlukla yüksek yanlılık (high bias) yatar. Model, hedef fonksiyonu temsil etmek için gereken matematiksel karmaşıklıktan yoksundur. Doğrusal bir modelle sinüs eğrisini ya da görsel nesne sınıflandırmasını öğrenmek buna tipik örnektir. Bunun yanı sıra fazla agresif L1/L2 düzenlileştirmesi model ağırlıklarını sıfıra iterek öğrenme kapasitesini yok eder. Çok az epoch, çok yüksek öğrenme hızı ya da erken durdurma da benzer sonuçlar üretir. Bias-varyans ikilemi çerçevesinde underfitting, yüksek bias-düşük varyans bölgesine karşılık gelir. Model çok basit olduğundan farklı eğitim kümeleri verseniz bile tahminler tutarlı ama sistematik biçimde yanlış kalır. Öğrenme eğrisi (learning curve) incelendiğinde hem eğitim hem doğrulama kaybının yüksek ve birbirine yakın seyrettiği görülür; daha fazla veri eklemek de bu platoya takılmış performansı iyileştirmez. Teşhis için eğitim kaybını izlemek en güvenilir yöntemdir. Eğitim kaybı tatmin edici bir seviyeye hiç inemiyorsa önce model kapasitesi sorgulanmalıdır. Çözümler arasında mimari karmaşıklığı artırmak (daha fazla katman, nöron veya dikkat başlığı), polinom özellik dönüşümleriyle doğrusal modele zenginlik katmak, düzenlileştirme katsayısını azaltmak, epoch sayısını ve öğrenme oturumunu uzatmak ve alan uzmanlığından yararlanan kapsamlı özellik mühendisliği sayılabilir. Dropout oranı düşürülmeli, erken durdurma kriteri gevşetilmelidir. Modelin karmaşıklığı veri kümesinin büyüklüğüne ve çeşitliliğine orantılı biçimde seçilmelidir; aksi hâlde model hem eğitim hem de test kümesinde yüksek hata oranları sergilemeye devam eder.

Yetersiz Öğrenme Neden Oluşur?

En sık karşılaşılan neden, görevin karmaşıklığına oranla çok basit bir model seçimidir. Yüzlerce özelliğin etkileşiminden oluşan bir hedefi tek katmanlı küçük bir ağla öğrenmek imkânsızdır. Buna ek olarak, L1/L2 düzenlileştirmesi çok yüksek tutulduğunda model ağırlıklarını sıfıra zorlayarak öğrenme kapasitesini yok eder. Çok az epoch veya çok yüksek öğrenme hızı da parametrelerin doğru değerlere ulaşmasını engeller.

Bias-Varyans İkilemi Çerçevesinde

Makine öğrenmesinin temel dengesi olan bias-varyans ikilemi, underfitting ve overfitting'i iki uç nokta olarak konumlandırır. Yüksek bias, modelin veriyi sistematik biçimde yanlış temsil etmesi anlamına gelir; bu model ne kadar çok veri alırsa alsın performansı plateauya erişir ve iyileşmez. Yüksek varyans ise modelin eğitim verisine aşırı uyduğunu gösterir. İdeal model bu iki uç arasında bir denge noktasında çalışır.

Nasıl Teşhis Edilir?

Öğrenme eğrisi (learning curve) en güvenilir teşhis aracıdır. Eğer hem eğitim hem doğrulama kaybı yüksek ve birbirine yakınsa underfitting açıkça görülür. Overfitting'den farklı olarak aralarında büyük bir boşluk yoktur; her ikisi de tatmin edici bir seviyeye inmez. Eğitim kaybının hâlâ düşüyor olması, erken durdurma ile değil daha uzun eğitimle ve/veya model kapasitesi artırarak iyileştirme yapılabileceğine işaret eder.

Çözüm Stratejileri

  • check_circle Mimari Karmaşıklığı Artırma: Daha fazla katman veya nöron eklemek en doğrudan çözümdür. Transformer ya da derin CNN mimarilerine geçmek kapasite sorununu kökten çözebilir.
  • check_circle Özellik Mühendisliği: Polinom özellik dönüşümleri doğrusal modellere daha zengin ifade kapasitesi kazandırır. Alan uzmanlığından yararlanan özellik türetme de güçlü bir alternatiftir.
  • check_circle Düzenlileştirmeyi Azaltma: L1/L2 katsayıları (lambda) küçültülerek modelin daha özgür öğrenmesi sağlanır. Dropout oranı düşürülür; ağ, verideki kalıpları daha agresif biçimde öğrenir.
  • check_circle Daha Uzun Eğitim: Epoch sayısını ve öğrenme oturumunu uzatmak, erken durdurma kriterini gevşetmek parametrelerin doğru değerlere ulaşmasına fırsat tanır.

📉 Eksik Öğrenmeden Kurtulma Stratejileri

  • check_circle Model kapasitesini artırın: daha derin veya geniş ağ, daha fazla ağaç veya düğüm
  • check_circle Daha fazla özellik ekleyin: özellik mühendisliği veya gömü zenginleştirmesi ile ifade gücünü artırın
  • check_circle Düzenlileştirmeyi azaltın: L2 cezası veya dropout oranı gereğinden fazla olabilir
  • check_circle Daha uzun eğitim: erkenden durdurma eşiğini gevşetin; model henüz yakınsamış olmayabilir
  • check_circle Öğrenme hızı ve optimize edici: Adam yerine öğrenme hızı çizelgesi ile daha iyi yakınsama deneyin

Sıkça Sorulan Sorular

  • check_circle Underfitting mi overfitting mi daha kötüdür? Her ikisi de istenmeyen durumlardır. Ancak underfitting modelin hiçbir şey öğrenmediğini gösterdiğinden pratikte daha kolay fark edilir. Overfitting en azından eğitim verisinde iyi görünür, bu da yanıltıcı olabilir.
  • check_circle Daha fazla veri underfitting'i çözer mi? Hayır. Underfitting'in kökü model kapasitesindedir; veri artırmak yüksek bias sorununu çözmez. Önce model veya özellik zenginliğini artırın.
  • check_circle Validation kaybı eğitim kaybından düşükse ne anlama gelir? Genellikle şans eseri oluşan veri bölümlemesinden kaynaklanır ya da doğrulama setinin çok küçük olduğunu gösterir. Model hâlâ underfitting yapıyor olabilir; kayıp değerlerinin mutlak seviyesine bakın.
  • check_circle Transfer öğrenme underfitting'i önler mi? Evet. Önceden eğitilmiş büyük modellerin ağırlıkları, küçük veri setleriyle bile yeterli kapasite sunduğundan yetersiz öğrenme riskini önemli ölçüde azaltır.