Önyargı (Bias) Nedir?
Önyargı (bias), bir modelin gerçek ilişkiyi kavramak için yaptığı basitleştirici varsayımlardan kaynaklanan sistemik hatayı ifade eder. Yüksek önyargılı bir model, eğitim verisini doğru biçimde öğrenmekte başarısız olur; karmaşık örüntüleri göremez ve her koşulda benzer tahminler üretir. Sınıfik bir örnek olarak, ikinci dereceden bir eğri gösteren veriye düz bir çizgi uydurmaya çalışmak yüksek bias'a işaret eder. Eğitim setindeki hata yüksektir; modeli daha fazla eğitmek durumu iyileştirmez. Bu nedenle yüksek bias problemi, daha karmaşık bir model ailesi seçmek veya daha fazla özellik (feature) eklemekle çözülür.
Varyans (Variance) Nedir?
Varyans, modelin eğitim verisindeki rastgele gürültüye ne kadar duyarlı olduğunu ölçer. Yüksek varyanslı bir model, eğitim setini neredeyse ezberler; eğitim hatası çok düşükken test hatası çok yüksek olur. Farklı eğitim örnekleri üzerinde eğitildiğinde tahminler büyük ölçüde değişir. Çok derin karar ağaçları (budanmamış), yüksek dereceli polinomlar ve küçük veri kümeleri üzerinde eğitilmiş büyük sinir ağları bu durumun tipik örnekleridir. Yüksek varyans problemi, regularizasyon, erken durdurma (early stopping) veya daha fazla eğitim verisi elde etmekle giderilebilir.
Matematiksel Temel: Hata Ayrıştırması
Bir regresyon modelinin beklenen ortalama karesel hatası (MSE) üç bileşene ayrıştırılabilir: Toplam Hata = Bias² + Varyans + Gürültü. Burada Bias², modelin ortalama tahmininin gerçek değerden ne kadar saptığının karesidir. Varyans, farklı eğitim setleri kullanıldığında modelin tahminlerinin ne kadar değiştiğini gösterir. Gürültü ise verinin kendisinden kaynaklanan ve hiçbir model tarafından azaltılamayan sabit hatadır. Bu ayrıştırma, her modelin performansını iyileştirmenin önünde bir tavan olduğunu ortaya koyar ve hangi boyuta odaklanılması gerektiğini netleştirir.
Dengeyi Yönetmek: Pratik Teknikler
- check_circle Regularizasyon (L1/L2): Model ağırlıklarına ceza ekleyerek aşırı karmaşık modellerin eğitim verisine yapışmasını önler. L2 (Ridge) ağırlıkları küçültür; L1 (Lasso) bazı ağırlıkları tamamen sıfırlar. Her ikisi de varyansı düşürürken biraz bias ekler.
- check_circle Çapraz Doğrulama (Cross-Validation): Modelin gerçek genelleştirme gücünü ölçerek hem underfitting hem de overfitting'i tespit eder. k-fold cross-validation, veriyi k parçaya böler ve her seferinde farklı bir parçayı test seti olarak kullanır; bu sayede model değerlendirmesi güvenilir hale gelir.
- check_circle Ensemble Yöntemleri: Random Forest, birçok yüksek varyanslı karar ağacının ortalama tahminini alarak varyansı azaltır. Gradient Boosting ise birbirini düzelten zayıf modeller zinciriyle bias'ı azaltır. Ensemble yöntemleri, bias-variance dengesini yönetmede en güçlü araçlardan biridir.
- check_circle Dropout: Derin sinir ağlarında eğitim sırasında rastgele nöronları devre dışı bırakan bu teknik, modelin herhangi bir nöron grubuna aşırı bağımlı hale gelmesini engeller ve etkin bir varyans azaltma sağlar.
- check_circle Hiperparametre Ayarı: Ağaç derinliği, öğrenme oranı, gizli katman sayısı gibi hiperparametrelerin doğru seçimi, modeli bias-variance dengesinin optimum noktasına taşır. Grid search veya Bayesian optimizasyon bu arama sürecini otomatikleştirir.
Öğrenme Eğrileriyle Teşhis
Öğrenme eğrileri, eğitim seti boyutu arttıkça hem eğitim hem test hatasının nasıl değiştiğini görselleştirir. Yüksek bias durumunda, eğitim hatası başından yüksek seyreder ve veri eklendikçe test hatasıyla yakınsayarak yüksek bir platoda buluşur. Yüksek varyans durumunda ise eğitim hatası düşük, test hatası yüksektir ve ikisi arasındaki makas uzun süre kapanmaz. Bu grafikleri yorumlamak, doğru müdahaleyi seçmek için kritik öneme sahiptir: eğriler yakınsamışsa daha fazla veri yardımcı olmaz, model değiştirilmelidir; iki eğri arasında büyük fark varsa daha fazla veri veya regularizasyon ile varyans düşürülebilir.
Gerçek Hayat Örnekleri
- check_circle Tıbbi Teşhis Modeli: Kanser teşhisi için yalnızca hasta yaşını kullanan basit bir model yüksek bias gösterir; hastalığın diğer belirleyici özelliklerini görmezden gelir. Öte yandan hastanın tüm ham verilerini ezberleyen bir model yüksek varyans gösterir; yeni hastalarda başarısız olur. İdeal model, doğru özellik seçimi ve regularizasyon ile ikisi arasında denge kurar.
- check_circle Fiyat Tahmin Modeli: Bir ev fiyat tahmin modelinde yalnızca metrekareye bakan doğrusal regresyon yüksek bias yaratır. Aksine, her adres ve özel ayrıntıyı hatırlayan çok derin bir ağaç, eğitim setindeki fiyatları mükemmel tahmin eder ama yeni evlerde çöker. Cross-validation ve regularizasyon, modelin gerçek piyasa dinamiklerini öğrenmesini sağlar.
- check_circle Doğal Dil İşleme: Küçük veri setiyle eğitilen büyük bir dil modeli yüksek varyansa yatkındır; eğitim metnini ezberler ama yeni cümleleri anlayamaz. Dropout ve weight decay bu riski azaltır. Yetersiz parametre sayısına sahip küçük bir model ise dilsel nüansları yakalayamaz ve bias baskın olur.
Sık Sorulan Sorular
- check_circle Bias ve variance aynı anda düşürülebilir mi? Genellikle zordur; model basitleşince bias artar, karmaşıklaşınca varyans artar. Ancak ensemble yöntemleri (özellikle Gradient Boosting) ve iyi hiperparametre optimizasyonu her ikisini birden baskılamaya yaklaşabilir. Yeterli veri miktarı da varyansı düşürerek trade-off'u yumuşatır.
- check_circle Hangi durumda bias, hangi durumda variance sorunu ön planda? Eğitim ve test hataları ikisi de yüksekse bias baskındır; model değiştirilmeli veya özellik mühendisliği yapılmalıdır. Eğitim hatası düşük ama test hatası yüksekse varyans baskındır; regularizasyon, dropout veya daha fazla veri gereklidir.
- check_circle Derin öğrenme modelleri bu tradeoff'tan nasıl etkilenir? Çok katmanlı sinir ağları yüksek kapasiteleriyle varyansa yatkındır. Dropout, batch normalization ve weight decay gibi teknikler varyansı baskılar. Ayrıca modern büyük dil modellerinde 'double descent' fenomeni gözlemlenir: model çok büyüyünce test hatası tekrar düşmeye başlar, klasik tradeoff eğrisi bozulur.
- check_circle Az veriyle bias-variance dengesi nasıl yönetilir? Az veri varken yüksek varyans riski çok büyük olduğundan basit modeller (doğrusal modeller, küçük ağaçlar) tercih edilmelidir. Veri çoğaltma (data augmentation) ve transfer learning de varyansı dolaylı yoldan azaltır. k-fold cross-validation, sınırlı veriden maksimum bilgi çıkarmak için zorunludur.
- check_circle Bias-variance tradeoff sınıflandırma problemlerinde de geçerli mi? Evet. Sınıflandırmada hata genellikle 0-1 kaybıyla ölçülse de benzer bir ayrıştırma geçerlidir. Yüksek bias, karar sınırını çok basit tutar (doğrusal sınır karmaşık sınıfları ayıramaz); yüksek varyans, karar sınırını eğitim verisindeki gürültüye göre büker. AUC-ROC ve precision-recall eğrileri bu dengeyi test setinde değerlendirmek için kullanılır.