Supervised Learning (Denetimli Öğrenme)

Her girdinin doğru çıktısıyla etiketlendiği veri setiyle model eğitme yöntemi; sınıflandırma ve regresyon görevlerinin temelidir.

Denetimli Öğrenme (Supervised Learning), makine öğrenmesinin temel paradigmalarından biridir. Bu yaklaşımda model, her girdinin (X) karşılığında doğru çıktının (y/etiket) önceden bilindiği ve işaretlendiği bir veri setiyle eğitilir. Model, bu etiketli örneklerden X→y eşlemesini öğrenerek daha önce hiç görmediği yeni verilerde tahmin yapabilir hale gelir. Kavramı anlamak için bir öğretmen-öğrenci analojisi kullanılır: öğretmen (veri seti), öğrenciye (modele) hem soruları hem de cevap anahtarını verir. Öğrenci, hataları analiz ederek zamanla doğru cevapları öğrenir. Gerçek hayatta bu etiketler bir e-postanın spam olup olmadığı, bir tümörün iyi ya da kötü huylu olması ya da bir evin tahmini satış fiyatı olabilir. Denetimli öğrenme iki ana problem türünü kapsar. İlki sınıflandırma (classification): girdi verisini iki veya daha fazla ayrık kategoriye atamak. Spam tespiti, görüntü tanıma ve duygu analizi bu gruba girer. İkincisi regresyon: sürekli sayısal bir değer tahmin etmek. Ev fiyatı tahmini, hava sıcaklığı öngörüsü ve borsa tahmini bu gruba aittir. Algoritma ailesi oldukça geniştir: karar ağaçları, rastgele orman (Random Forest), destek vektör makineleri (SVM), lojistik regresyon, yapay sinir ağları ve derin öğrenme modelleri. Tablo verisi için XGBoost ve LightGBM çoğu yarışmada lider performans gösterirken, görüntü işleme için konvolüsyonel sinir ağları (CNN) ve metin görevleri için BERT gibi transformer modeller tercih edilir. Eğitim süreci; veriyi eğitim, doğrulama ve test kümelerine bölmeyi, bir kayıp fonksiyonu (loss function) tanımlamayı ve gradient descent ile modelin parametrelerini optimize etmeyi içerir. Aşırı öğrenme (overfitting) ve eksik öğrenme (underfitting) risklerine karşı çapraz doğrulama, düzenlileştirme (L1/L2) ve erken durdurma (early stopping) gibi teknikler kullanılır. Denetimli öğrenmenin en büyük kısıtı kaliteli etiketli veriye olan ihtiyacıdır. Manuel etiketleme zaman alıcı ve pahalıdır; ayrıca insan yanlılığı veya hatalarına açıktır. Bu soruna çözüm olarak aktif öğrenme (active learning) ve yarı-denetimli öğrenme (semi-supervised learning) yaklaşımları geliştirilmiştir.

school Nasıl Çalışır?

Model, etiketlenmiş binlerce veya milyonlarca örneği inceler. Örneğin, modele kedi ve köpek fotoğrafları verilir ve her birinin altında kedi veya köpek etiketi bulunur. Algoritma pikseller ile etiketler arasındaki matematiksel ilişkiyi keşfeder. Eğitim bittiğinde, daha önce hiç görmediği bir kedi fotoğrafı gösterildiğinde doğru etiketi tahmin edebilir.

Temel Problem Türleri

category Sınıflandırma (Classification)

Çıktının belirli bir kategori olduğu durumlardır. (Örn: E-postanın spam olup olmadığı, tümörün iyi/kötü huylu olması).

trending_up Regresyon (Regression)

Çıktının sürekli bir sayısal değer olduğu durumlardır. (Örn: Bir evin metrekaresine göre fiyatını tahmin etmek, borsa tahmini).

Denetimli Öğrenme Algoritmaları

  • check_circle Sınıflandırma Algoritmaları: Lojistik regresyon: ikili sınıflandırma; hızlı, yorumlanabilir. Karar ağacı: kural tabanlı; görselleştirilebilir ama aşırı öğrenme riski. Random Forest: çok sayıda karar ağacı topluluğu; güçlü ve sağlam. XGBoost ve LightGBM: gradyan artıştırma; tablo verisi yarışmalarında lider. SVM: yüksek boyutlu uzayda etkili; kernel trick ile doğrusal olmayan sınır.
  • check_circle Regresyon Algoritmaları: Doğrusal regresyon: sürekli çıktı; basit, hızlı, yorumlanabilir. Ridge ve Lasso: düzenlileştirme eklenmiş regresyon; aşırı öğrenme azalır. Polynomial regresyon: doğrusal olmayan ilişkiler. SVR: destek vektör regresyon. Derin öğrenme: görüntü, ses, metin gibi yüksek boyutlu giriş için.
  • check_circle Eğitim ve Değerlendirme: Eğitim/doğrulama/test bölmesi: tipik 70/15/15 veya 80/10/10. Çapraz doğrulama (k-fold): küçük veri setlerinde güvenilir değerlendirme. Sınıflandırma metrikleri: doğruluk, precision, recall, F1, AUC-ROC. Regresyon metrikleri: MAE, RMSE, R².

Önemli Kavramlar

Overfitting ve underfitting: modelin eğitim verisine çok (overfitting) veya çok az (underfitting) uyması. Yanlılık-varyans dengesi (bias-variance tradeoff): basit model yüksek yanlılık, karmaşık model yüksek varyans eğilimindedir. Düzenlileştirme: L1 (Lasso), L2 (Ridge), Dropout — aşırı öğrenmeyi önler. Özellik mühendisliği: ham veriyi modele uygun özelliğe dönüştürme. Sınıf dengesizliği: SMOTE, class weight ve focal loss ile ele alınır.

quiz Sık Sorulan Sorular

  • check_circle Denetimli öğrenme nedir?: Her eğitim örneğinin girdi (özellik) ve beklenen çıktı (etiket) içerdiği makine öğrenmesi paradigmasıdır; model bu etiketli örneklerden X→y eşlemesini öğrenir.
  • check_circle Denetimli öğrenme ne zaman kullanılmalı?: Etiketli veri mevcut olduğunda. Spam tespiti, kredi skoru, hastalık teşhisi ve görüntü sınıflandırma denetimli öğrenme görevleridir.
  • check_circle Hangi algoritmalar kullanılır?: Karar ağaçları, Random Forest, SVM, lojistik regresyon ve derin öğrenme en yaygın seçeneklerdir; tablo verisi için XGBoost başlangıç için güçlü seçimdir.
  • check_circle Dezavantajları nelerdir?: Manuel etiketleme pahalı, yavaş ve insan önyargısına açıktır; etiketli veri azlığında model performansı düşer.
  • check_circle Kaç etiketli örnek gerekir?: Basit modeller için sınıf başına 50-100 yeterli; Random Forest için 500-1000; derin öğrenme için binlerce. Transfer öğrenme küçük veri setlerinde yardımcı olur.
  • check_circle Denetimli öğrenmede hangi algoritma seçilmeli?: Tablo verisi: XGBoost/LightGBM. Görüntü: CNN veya vision transformer. Metin: fine-tune edilmiş BERT. Zaman serisi: LSTM veya XGBoost + zaman özellikleri.