school Nasıl Çalışır?
Model, etiketlenmiş binlerce veya milyonlarca örneği inceler. Örneğin, modele kedi ve köpek fotoğrafları verilir ve her birinin altında kedi veya köpek etiketi bulunur. Algoritma pikseller ile etiketler arasındaki matematiksel ilişkiyi keşfeder. Eğitim bittiğinde, daha önce hiç görmediği bir kedi fotoğrafı gösterildiğinde doğru etiketi tahmin edebilir.
Temel Problem Türleri
category Sınıflandırma (Classification)
Çıktının belirli bir kategori olduğu durumlardır. (Örn: E-postanın spam olup olmadığı, tümörün iyi/kötü huylu olması).
trending_up Regresyon (Regression)
Çıktının sürekli bir sayısal değer olduğu durumlardır. (Örn: Bir evin metrekaresine göre fiyatını tahmin etmek, borsa tahmini).
Denetimli Öğrenme Algoritmaları
- check_circle Sınıflandırma Algoritmaları: Lojistik regresyon: ikili sınıflandırma; hızlı, yorumlanabilir. Karar ağacı: kural tabanlı; görselleştirilebilir ama aşırı öğrenme riski. Random Forest: çok sayıda karar ağacı topluluğu; güçlü ve sağlam. XGBoost ve LightGBM: gradyan artıştırma; tablo verisi yarışmalarında lider. SVM: yüksek boyutlu uzayda etkili; kernel trick ile doğrusal olmayan sınır.
- check_circle Regresyon Algoritmaları: Doğrusal regresyon: sürekli çıktı; basit, hızlı, yorumlanabilir. Ridge ve Lasso: düzenlileştirme eklenmiş regresyon; aşırı öğrenme azalır. Polynomial regresyon: doğrusal olmayan ilişkiler. SVR: destek vektör regresyon. Derin öğrenme: görüntü, ses, metin gibi yüksek boyutlu giriş için.
- check_circle Eğitim ve Değerlendirme: Eğitim/doğrulama/test bölmesi: tipik 70/15/15 veya 80/10/10. Çapraz doğrulama (k-fold): küçük veri setlerinde güvenilir değerlendirme. Sınıflandırma metrikleri: doğruluk, precision, recall, F1, AUC-ROC. Regresyon metrikleri: MAE, RMSE, R².
Önemli Kavramlar
Overfitting ve underfitting: modelin eğitim verisine çok (overfitting) veya çok az (underfitting) uyması. Yanlılık-varyans dengesi (bias-variance tradeoff): basit model yüksek yanlılık, karmaşık model yüksek varyans eğilimindedir. Düzenlileştirme: L1 (Lasso), L2 (Ridge), Dropout — aşırı öğrenmeyi önler. Özellik mühendisliği: ham veriyi modele uygun özelliğe dönüştürme. Sınıf dengesizliği: SMOTE, class weight ve focal loss ile ele alınır.
quiz Sık Sorulan Sorular
- check_circle Denetimli öğrenme nedir?: Her eğitim örneğinin girdi (özellik) ve beklenen çıktı (etiket) içerdiği makine öğrenmesi paradigmasıdır; model bu etiketli örneklerden X→y eşlemesini öğrenir.
- check_circle Denetimli öğrenme ne zaman kullanılmalı?: Etiketli veri mevcut olduğunda. Spam tespiti, kredi skoru, hastalık teşhisi ve görüntü sınıflandırma denetimli öğrenme görevleridir.
- check_circle Hangi algoritmalar kullanılır?: Karar ağaçları, Random Forest, SVM, lojistik regresyon ve derin öğrenme en yaygın seçeneklerdir; tablo verisi için XGBoost başlangıç için güçlü seçimdir.
- check_circle Dezavantajları nelerdir?: Manuel etiketleme pahalı, yavaş ve insan önyargısına açıktır; etiketli veri azlığında model performansı düşer.
- check_circle Kaç etiketli örnek gerekir?: Basit modeller için sınıf başına 50-100 yeterli; Random Forest için 500-1000; derin öğrenme için binlerce. Transfer öğrenme küçük veri setlerinde yardımcı olur.
- check_circle Denetimli öğrenmede hangi algoritma seçilmeli?: Tablo verisi: XGBoost/LightGBM. Görüntü: CNN veya vision transformer. Metin: fine-tune edilmiş BERT. Zaman serisi: LSTM veya XGBoost + zaman özellikleri.