tag Model Değerlendirme
Bu sayfada Model Değerlendirme etiketi ile işaretlenmiş 9 yapay zeka kavramını bulabilirsiniz.
Veri sızıntısı (data leakage), makine öğrenimi modelinin eğitim sürecine gerçek dünya tahmin anında bulunmaması ya da bilinmemesi gereken bilgilerin karışması ve bu durumun modelin performans değerlendirmesini yanıltmasıdır. Ortaya çıkan en belirgin belirti, geliştirme aşamasında olağandışı yüksek doğruluk, F1 veya AUC değerleri elde edilmesidir; ancak model üretime geçtiğinde bu başarım bir anda çöker çünkü o "sızan" bilgi artık mevcut değildir. Veri sızıntısının iki ana türü vardır. Birinci tür olan hedef sızıntısı (target leakage), eğitim setindeki bir özelliğin tahmin edilmek istenen sonuçla zamansal ya da korelasyonel bağ üzerinden kirlendiği durumu tanımlar. Klasik örnek: sigorta hasar tahmin modelinde "hasar sonrası müşteri iletişim kaydı" özelliğinin kullanılması. Bu değişken modelin sonucu önceden "bilmesine" yol açar; üretimde tahmin anında henüz o kayıt oluşmadığından model başarısız olur. İkinci tür olan eğitim-test kirliği ise ön işleme adımlarının test verisine sıçramasından kaynaklanır. StandardScaler veya MinMaxScaler'ı tüm veri seti üzerinde fit edip ardından bölümleme yapmak bu hatanın en yaygın biçimidir: test setinden gelen istatistikler normalleştirmede kullanıldığından test seti gerçek anlamda görülmemiş olmaktan çıkar. Zaman serisi verileri özellikle yüksek risk taşır. Rastgele train/test bölümlemesi bu tür verilerde her zaman yanlıştır: gelecekteki gözlemler eğitim setine girebilir ve model aslında geleceği görerek geçmişi tahmin eder. Doğru yöntem TimeSeriesSplit veya walk-forward validation kullanmaktır. Tespitte en etkili yöntem, Scikit-learn Pipeline nesneleridir: her çapraz doğrulama kıvrımında ön işleme adımlarını yalnızca o kıvrımın eğitim verisine uyguladığından test kirliğini yapısal olarak engeller. Özellik önem sıralamalarında şaşırtıcı derecede yüksek katkı gösteren değişkenler hedef sızıntısı açısından mutlaka sorgulanmalıdır. Üretim ile geliştirme ortamı arasındaki ani performans düşüşü her zaman veri sızıntısının güçlü bir göstergesidir.
Data Leakage (Veri Sızıntısı (Data Leakage))
Veri sızıntısı (data leakage), makine öğrenimi modelinin eğitim sürecine gerçek dünya tahmin anında bulunmaması ya da bilinmemesi gereken bilgilerin karışması ve bu durumun modelin performans değerlendirmesini yanıltmasıdır. Ortaya çıkan en belirgin belirti, geliştirme aşamasında olağandışı yüksek doğruluk, F1 veya AUC değerleri elde edilmesidir; ancak model üretime geçtiğinde bu başarım bir anda çöker çünkü o "sızan" bilgi artık mevcut değildir. Veri sızıntısının iki ana türü vardır. Birinci tür olan hedef sızıntısı (target leakage), eğitim setindeki bir özelliğin tahmin edilmek istenen sonuçla zamansal ya da korelasyonel bağ üzerinden kirlendiği durumu tanımlar. Klasik örnek: sigorta hasar tahmin modelinde "hasar sonrası müşteri iletişim kaydı" özelliğinin kullanılması. Bu değişken modelin sonucu önceden "bilmesine" yol açar; üretimde tahmin anında henüz o kayıt oluşmadığından model başarısız olur. İkinci tür olan eğitim-test kirliği ise ön işleme adımlarının test verisine sıçramasından kaynaklanır. StandardScaler veya MinMaxScaler'ı tüm veri seti üzerinde fit edip ardından bölümleme yapmak bu hatanın en yaygın biçimidir: test setinden gelen istatistikler normalleştirmede kullanıldığından test seti gerçek anlamda görülmemiş olmaktan çıkar. Zaman serisi verileri özellikle yüksek risk taşır. Rastgele train/test bölümlemesi bu tür verilerde her zaman yanlıştır: gelecekteki gözlemler eğitim setine girebilir ve model aslında geleceği görerek geçmişi tahmin eder. Doğru yöntem TimeSeriesSplit veya walk-forward validation kullanmaktır. Tespitte en etkili yöntem, Scikit-learn Pipeline nesneleridir: her çapraz doğrulama kıvrımında ön işleme adımlarını yalnızca o kıvrımın eğitim verisine uyguladığından test kirliğini yapısal olarak engeller. Özellik önem sıralamalarında şaşırtıcı derecede yüksek katkı gösteren değişkenler hedef sızıntısı açısından mutlaka sorgulanmalıdır. Üretim ile geliştirme ortamı arasındaki ani performans düşüşü her zaman veri sızıntısının güçlü bir göstergesidir.
A/B Testi (A/B Testi)
A/B testi, iki farklı sürümü (A kontrol, B deney) kullanıcılara rastgele göstererek hangisinin daha iyi performans gösterdiğini belirleyen istatistiksel bir deney yöntemidir. Makine öğrenmesinde model değerlendirmesinin temel taşı olan A/B testi; web uygulamalarından öneri sistemlerine, dil modellerinden görüntü sınıflandırıcılara kadar geniş bir alanda kullanılır. Testin çalışma mantığı şu adımlara dayanır: Kullanıcılar rastgele iki gruba ayrılır. A grubu mevcut sistemi (kontrol), B grubu yeni modeli veya özelliği (deney) deneyimler. Belirli bir süre sonra tıklama oranı, dönüşüm, RMSE veya doğruluk gibi metrikler karşılaştırılır; istatistiksel anlamlılık p-değeri ve güven aralığı ile ölçülür. Makine öğrenmesi ekipleri A/B testini şu senaryolarda kullanır: Yeni model sürümünü üretim ortamında doğrulama, hiperparametre değişikliklerinin gerçek etkisini ölçme, farklı öneri algoritmalarını kullanıcı katılımıyla karşılaştırma ve özellik mühendisliği değişikliklerinin işletme metriklerine katkısını ölçme. Sık karşılaşılan tuzaklar arasında erken sonuç okuma (peeping problem), çoklu karşılaştırma yanılgısı (Bonferroni düzeltmesi gerektirir), yeterli örneklem büyüklüğü hesaplamamak ve kullanıcı segmentasyonu farklarını göz ardı etmek sayılabilir. Sıralı A/B testi (sequential testing) ise bu sorunları azaltmak için erken durdurma kuralları kullanır. Kanary dağıtımı (canary deployment) ve gölge modu (shadow mode) A/B testinin üretim ortamında uygulandığı ileri düzey varyantlardır. Kanary dağıtımında yeni model yalnızca küçük bir trafik dilimine sunularak riskler sınırlandırılır; gölge modunda ise yeni model gerçek trafiği paralel olarak işler ancak kullanıcıya hiçbir zaman yanıt vermez. Türkiye'de büyük e-ticaret ve fintech platformları üretim ML sistemlerini bu yöntemlerle doğrulamaktadır. Yaygın araçlar: MLflow Experiments, Amazon SageMaker Experiments, Optimizely ve açık kaynak Wasabi. Interleaved (karışık) A/B testi ise öneri ve arama sistemleri için özel olarak geliştirilmiş bir varyantdır: A ve B sistemlerinin sonuçları tek bir listeye interleave edilerek kullanıcı tıklamaları üzerinden hangisinin daha iyi sıralama yaptığı çıkarılır. Bu yöntem, klasik A/B testi karşılaştırmasına göre çok daha hızlı istatistiksel güç elde etmeyi sağlar.
Benchmark (AI Değerlendirme)
Yapay zeka (YZ) dünyasında benchmark, bir modelin belirli görevlerdeki yeteneklerini standart ve yeniden üretilebilir biçimde ölçen değerlendirme çerçevesidir. Benchmark'lar; araştırmacıların, şirketlerin ve kullanıcıların farklı modelleri nesnel olarak karşılaştırmasına olanak tanır ve alan genelinde ilerlemenin izlenebilmesini sağlar. En etkili YZ benchmark'larından biri MMLU (Massive Multitask Language Understanding), 57 farklı konu alanını (matematik, hukuk, tıp, tarih) kapsayan 14.000'den fazla çoktan seçmeli soruyla oluşturulmuş kapsamlı bir dil anlama testidir. GPT-4, 2023'te bu testte insan uzman ortalamasını (86,4%) aşan ilk model oldu. Kod yazma yeteneğini ölçen HumanEval ise OpenAI tarafından geliştirilen 164 Python fonksiyon görevinden oluşur; model, testleri geçen işlevsel kod yazmak zorundadır. Daha da zorlu SWE-Bench, GitHub'dan derlenen 2.294 gerçek yazılım hatasını içerir ve modelin anlamlı bir patch üretip CI pipeline'ını geçmesini bekler. Günümüzde kullanılan diğer önemli benchmark'lar arasında mantıksal akıl yürütmeyi ölçen MATH, çoklu adım muhakemesini test eden BIG-Bench Hard ve doktora düzeyi STEM sorularını kapsayan GPQA Diamond sayılabilir. ARC-AGI ise makine öğrenimi modellerinin insan benzeri soyutlama yapıp yapamadığını test etmek için Francois Chollet tarafından tasarlanmıştır. İnsan tercihi esasına dayalı değerlendirme platformu Chatbot Arena ise 1 milyondan fazla kör karşılaştırma oyu üzerinden ELO puanı hesaplar; çoktan seçmeli testlerin yetersiz kaldığı yaratıcılık ve faydalılık gibi boyutları kapsar. Benchmark değerlendirmesinde önemli bir risk "contamination" (veri kirliliği) sorunudur: eğitim kümesine test sorularının karışması, model puanını yapay olarak şişirir ve gerçek yeteneği gizler. Bunun yanı sıra Goodhart Yasası gereği benchmark optimize eden modeller gerçek dünya performansında zayıf kalabilir. Bu nedenle tek bir benchmark sonucuna değil, farklı yetenekleri ölçen geniş bir test portföyüne bakmak; sürüm dönemlerini not etmek ve mümkün olduğunda özel (heldout) veri setleri üzerinde doğrulama yapmak araştırma standartlarına uygun bir yaklaşımdır.
Çapraz Doğrulama (Çapraz Doğrulama)
Çapraz doğrulama (cross-validation), makine öğrenimi modellerinin görülmemiş veriler üzerindeki gerçek performansını tarafsız biçimde tahmin etmek için kullanılan istatistiksel bir değerlendirme tekniğidir. Temel fikir, mevcut eğitim verisini birden fazla alt kümeye (fold) bölmek ve her birini dönüşümlü olarak test kümesi olarak kullanmaktır; böylece modelin tüm veri üzerindeki davranışı sistematik biçimde ölçülür. En Yaygın Yöntemler K-Katlamalı Çapraz Doğrulama (k-Fold Cross-Validation): Veri kümesi k eşit parçaya (fold) bölünür. Model, her iterasyonda k-1 parça üzerinde eğitilir ve kalan 1 parça üzerinde test edilir; bu döngü k kez tekrarlanır. Ortalama hata skoru, modelin genel performansının tarafsız tahmini olarak kabul edilir. Pratikte k=5 veya k=10 en sık tercih edilen değerlerdir; bu seçim önyargı-varyans dengesi açısından pratik optimum noktalardır. Biri Dışarıda Bırak (Leave-One-Out / LOO): k değeri veri kümesinin örnek sayısına eşitlenir; her seferinde yalnızca tek bir örnek test için ayrılır. Küçük veri setlerinde maksimum bilgiyi kullanmanın yolu olsa da büyük veri setlerinde hesaplama maliyeti aşırı artar. Tabakalı K-Katlamalı (Stratified k-Fold): Katlar oluşturulurken her kattaki sınıf oranı korunur. Dengesiz sınıf dağılımlarında (fraud detection, tıbbi teşhis gibi) standart k-fold gerçekçi olmayan sonuçlar üretebileceği için bu yöntem tercih edilir. Neden Gereklidir? Tek bir eğitim/test bölünmesi, bölünmenin rastlantısallığına bağlı olarak aşırı iyimser ya da kötümser sonuçlar üretebilir. Çapraz doğrulama bu varyansı azaltır ve modelin aşırı uyum (overfitting) yaşayıp yaşamadığını nesnel biçimde ortaya koyar. Özellikle küçük ve orta ölçekli veri kümelerinde güvenilir performans tahmini için vazgeçilmez bir araçtır. Hiperparametre Ayarı ile Kullanımı Çapraz doğrulama, hiperparametre optimizasyonunun standart parçasıdır. Grid Search veya Random Search algoritmalarıyla birleştirildiğinde her parametre kombinasyonu k kez değerlendirilir. Bu yaklaşım test verisinin dolaylı yollardan eğitime sızmasını (data leakage) önler ve seçilen modelin gerçek dünya performansını daha doğru yansıtır. Sınırlılıklar ve Özel Durumlar k arttıkça hesaplama süresi katlanarak büyür; büyük derin öğrenme modellerinde standart k-fold pratikte pahalı hale gelebilir. Zaman serisi gibi sıralı verilerde standart k-fold geçersizdir çünkü gelecekteki verilerle geçmişi eğitmek sızıntıya (data leakage) neden olur; bu senaryolarda Walk-Forward Validation veya TimeSeriesSplit yöntemleri kullanılır. Çapraz doğrulama, veri biliminin temel kalite güvencesi araçlarından biridir: hem model seçimini hem de genelleme gücünün tahminini istatistiksel olarak sağlam bir temele oturtur.
Precision-Recall (Kesinlik-Duyarlılık)
Precision (Kesinlik) ve Recall (Duyarlılık), makine öğrenmesinde sınıflandırma modellerinin performansını değerlendirmek için kullanılan iki temel ölçüttür. Her ikisi de Confusion Matrix üzerinden türetilir ve birbirini tamamlayan iki farklı bakış açısını yansıtırken aynı zamanda uygulamanın gereksinimlerine göre farklı öncelikler taşır. Precision formülü: TP / (TP + FP). Model "Evet" dediği tahminler arasında gerçekten doğru olanların oranıdır. Örneğin spam tespitinde yüksek Precision, meşru e-postaların yanlışlıkla spam klasörüne atılmadığını güvence altına alır. Düşük Precision, sistemin fazla sayıda yanlış alarm ürettiğini gösterir ve kullanıcı deneyimini olumsuz etkiler. Recall formülü: TP / (TP + FN). Tüm gerçek pozitif örnekler arasında modelin doğru yakaladıklarının oranıdır. Tıbbi teşhiste yüksek Recall, hasta bireylerin gözden kaçırılmadığını garantiler. Düşük Recall, sistemin gerçek pozitiflerin önemli bir bölümünü atladığını ve ciddi sonuçlara yol açabileceğini gösterir. Precision-Recall Dengesi (Trade-off): İki ölçüt birbiriyle ters orantılıdır. Model eşik değeri düşürüldüğünde daha fazla pozitif tahmin yapılır, Recall yükselirken Precision düşer. Eşik yükseltildiğinde tam tersi gerçekleşir. Hangi dengenin tercih edileceği, uygulamanın kaçırma maliyetine ve yanlış alarm maliyetine bağlıdır. F1-Score ve AUC-PR: İki ölçütü tek değerde özetlemek için harmonik ortalamayı kullanan F1-Score tercih edilir: 2 × (Precision × Recall) / (Precision + Recall). Precision-Recall Eğrisi (PR Curve), farklı eşiklerdeki dengeyi görselleştirir; eğrinin altındaki alan (AUC-PR) özellikle dengesiz (imbalanced) veri kümelerinde ROC-AUC'a göre daha bilgilendirici bir genel performans göstergesidir. LLM ve RAG sistemlerinde Precision@k ile Recall@k metrikleri, geri çekilen ilk k belge arasında kaçının alaka düzeyinde olduğunu ve tüm alakalı belgelerin ne kadarının döndürüldüğünü ölçer. RAGAS ve TruLens gibi RAG değerlendirme çerçeveleri bu ölçütleri merkeze alır ve boru hattının retrieval kalitesini sistematik biçimde izler.
Statistical Inference (İstatistiksel Çıkarım)
İstatistiksel çıkarım, sınırlı bir veri örnekleminden hareketle daha geniş bir kitle hakkında genellemeler ve tahminler yapma sürecidir. Veri biliminin temel taşlarından biri olan bu disiplin, gözlemlenemeyecek kadar büyük ya da erişimi kısıtlı popülasyonları anlamak için olasılık teorisinden yararlanır. Çıkarımsal istatistik iki ana ekol üzerine inşa edilmiştir. Frekansçı yaklaşım, parametreleri sabit birer değer olarak kabul eder; hipotez testleri ve güven aralıkları aracılığıyla sonuçlara ulaşır. Null hipotez (H0) belirlenerek p-değerine göre reddedilip reddedilmeyeceğine karar verilir: p < 0,05 eşiği, gözlemlerin rastlantısal değil anlamlı olduğuna işaret eder. Bayesçi yaklaşım ise olasılığı bir inanç derecesi olarak tanımlar; alan bilgisini (prior) yeni verilerle birleştirip posterior dağılım üretir. Küçük örneklemlerde ve uzman bilgisinin sürece katılması gereken durumlarda bu yöntem tercih edilir. Veri bilimi ve makine öğrenmesi bağlamında istatistiksel çıkarım birçok kritik görevi üstlenir. Model değerlendirmede çapraz doğrulama skorlarının anlamlı farklılıklar içerip içermediği test edilir. A/B testlerinde iki gruba ait dönüşüm oranı farkının istatistiksel olarak anlamlı olup olmadığı belirlenir. Regresyon analizinde katsayıların sıfırdan farklı olup olmadığını güven aralıkları ortaya koyar. Özellik seçiminde ise chi-kare, ANOVA ve t-testi gibi testler, değişkenlerin bağımlı değişkenle gerçek bir ilişki taşıyıp taşımadığını sınar. Büyük veri döneminde istatistiksel anlamlılık tuzağı önem kazanmıştır: devasa örneklemlerde pratik açıdan önemsiz etkiler bile p < 0,05 değeri üretebilir. Bu nedenle etki büyüklüğü (Cohen d, eta-kare) ve pratik anlamlılık değerlendirmesi vazgeçilmez bir tamamlayıcı hâline gelmiştir. Yapay zeka modellerinin tahminlerindeki belirsizliği ölçmek için de çıkarımsal istatistik kullanılır; konformal tahmin ve Bayesçi derin öğrenme bu alanın güncel uzantılarıdır. Büyük dil modellerinin değerlendirilmesinde iki modelin performans farkının gerçek mi yoksa örnekleme gürültüsünden mi kaynaklandığını anlamak için bootstrap yeniden örnekleme ve McNemar testi yaygın araçlara dönüşmüştür.
ROC-AUC (ROC Eğrisi ve AUC)
ROC-AUC (Receiver Operating Characteristic - Eğri Altındaki Alan), ikili sınıflandırma modellerinin performansını karar eşiğinden bağımsız olarak değerlendiren temel bir metriktir. ROC eğrisi, modelin ürettiği olasılık tahminlerine farklı karar eşikleri uygulandığında elde edilen Gerçek Pozitif Oranı (TPR - Duyarlılık) ile Yanlış Pozitif Oranı (FPR - 1-Özgüllük) çiftlerini bir grafik üzerinde gösterir. AUC (Area Under the Curve) ise bu eğrinin altındaki alanı ifade eder ve modelin genel ayırt etme gücünü 0 ile 1 arasında tek bir sayıyla özetler. AUC değeri 1.0, modelin tüm pozitif ve negatif örnekleri mükemmel şekilde ayırt ettiğini; 0.5 ise modelin rastgele tahminle eşdeğer olduğunu gösterir. Pratikte 0.7-0.8 arası kabul edilebilir, 0.8-0.9 iyi, 0.9 üstü ise mükemmel performans olarak değerlendirilir. Sıfırın altındaki değerler modelin sistematik olarak yanlış sınıflandırma yaptığını işaret eder; bu nadir durum genellikle sınıf etiketlerinin ters çevrildiği anlamına gelir. ROC-AUC'nin en kritik avantajı dengesiz sınıf dağılımlarına karşı dayanıklı olmasıdır. Tıbbi tanı, dolandırıcılık tespiti ve kredi risk değerlendirmesi gibi nadir olayların baskın olduğu problemlerde doğruluk (accuracy) metriği yanıltıcı sonuçlar verebilirken, ROC-AUC gerçek model kalitesini doğru şekilde yansıtır. Örneğin, yüzde doksanı negatif sınıfa ait olan bir veri setinde, her örneği negatif tahmin eden bir model yüzde doksan doğruluk elde eder; ancak AUC skoru 0.5 olur ve modelin hiçbir ayırt etme gücü olmadığını açıkça ortaya koyar. Birden fazla modeli karşılaştırırken AUC skoru, hangi modelin tüm olası eşik değerleri boyunca daha tutarlı performans sergilediğini nesnel biçimde ortaya koyar. Bu özellik, eşik seçimini erteleyerek model seçim sürecini veriye dayalı kılar. Bununla birlikte, yüksek sınıf dengesizliğinin bulunduğu durumlarda Precision-Recall AUC (PR-AUC) tercih edilmesi önerilir; çünkü ROC-AUC negatif sınıftaki çok sayıda doğru tahmini ödüllendirerek gerçek pozitif başarısını gizleyebilir. Python ekosisteminde scikit-learn kütüphanesi, roc_auc_score() ve roc_curve() fonksiyonlarıyla bu metriğin hesaplanmasını kolaylaştırır. XGBoost, LightGBM ve sklearn pipeline'ları built-in AUC izleme destekler. Çok sınıflı problemlerde ise One-vs-Rest veya One-vs-One stratejisiyle makro ortalama AUC hesaplanabilir; bu yaklaşım her sınıfın ayırt etme gücünü ayrı ayrı raporlar.
Bias-Variance Tradeoff (Önyargı-Varyans Dengesi)
Bias-Variance Tradeoff (Önyargı-Varyans Dengesi), makine öğrenmesinde bir modelin tahmin hatası üzerindeki iki temel kaynağı arasındaki dengeyi açıklayan merkezi bir kavramdır. Bu iki kaynak —önyargı (bias) ve varyans (variance)— genellikle birbirinin tersi yönde hareket eder ve bu gerilim, model seçiminin özünü oluşturur. Önyargı (Bias), modelin gerçek ilişkiyi ne kadar basit varsaydığını ölçer. Yüksek önyargılı bir model, verinin karmaşık yapısını kavramak yerine aşırı basitleştirilmiş varsayımlar yapar. Örneğin, doğrusal olmayan bir probleme yalnızca doğrusal regresyon uygulamak bu duruma yol açar. Sonuç, hem eğitim hem test setinde yüksek hata oranı ve yetersiz öğrenme (underfitting) olarak kendini gösterir. Varyans (Variance), modelin eğitim verisindeki gürültüye ve rastgele dalgalanmalara ne kadar duyarlı olduğunu ölçer. Yüksek varyanslı bir model, eğitim setini adeta ezberler; eğitim hatası düşük, ancak test hatası yüksek olur. Bu aşırı öğrenme (overfitting) durumuna, çok derin karar ağaçları veya yüksek dereceli polinom modeller yol açabilir. Matematiksel olarak, bir modelin beklenen ortalama karesel hatası şöyle ayrıştırılır: Toplam Hata = Bias² + Varyans + Gürültü Gürültü terimi, verinin kendisinden kaynaklanan ve azaltılamayan bir sabit hatadır. Bias ve Varyans ise model karmaşıklığına doğrudan bağlıdır: model basitleştikçe bias artar, karmaşıklaştıkça varyans artar. Bu dengeyi pratikte yönetmek için yaygın olarak kullanılan teknikler şunlardır: Regularizasyon (L1/L2) varyansı azaltmak için model ağırlıklarını cezalandırır. Çapraz doğrulama (cross-validation), modelin gerçek genelleştirme gücünü ölçerek aşırı öğrenmeyi tespit eder. Ensemble yöntemleri (Random Forest, Gradient Boosting) birden fazla modeli birleştirerek hem önyargıyı hem de varyansı dengeler. Dropout, derin sinir ağlarında rastgele nöronları devre dışı bırakarak varyansı azaltır. Veri miktarının artması genellikle varyansı düşürür, çünkü model daha az rastgele örüntülere tutunmak zorunda kalır. Ancak önyargıyı azaltmak için doğru model ailesi seçimi şarttır; daha fazla veri yüksek önyargılı bir modeli iyileştirmez. Deneyimli veri bilimciler, öğrenme eğrilerini ve validasyon metriklerini analiz ederek modelin hangi uçta baskın hata ürettiğini tespit eder ve uygun müdahaleyi seçer.
Calibration (Model Kalibrasyonu)
Kalibrasyon (Model Calibration), bir makine öğrenimi modelinin ürettiği olasılık tahminlerinin gerçek olayların gözlemlenen sıklığıyla ne ölçüde örtüştüğünü ifade eden bir güvenilirlik kavramıdır. İyi kalibre edilmiş bir model, %80 olasılık verdiği örneklerin yaklaşık %80'inde gerçekten doğru sonuç üretir; %95 dediği durumların da büyük bölümünde haklı çıkar. Bu özellik doğruluk (accuracy) metriğinden bağımsızdır: yüksek doğruluklu bir model, güven skorlarını sistematik biçimde abartıyorsa zayıf kalibre edilmiş sayılır. Tıbbi teşhis, kredi riski değerlendirmesi ve özerk sistemler gibi kararların olasılık eşiklerine bağlandığı uygulamalarda kalibrasyon, tahmin doğruluğu kadar kritik bir öneme sahiptir. Kalibrasyon kalitesini ölçmek için en yaygın metrik Beklenen Kalibrasyon Hatası'dır (Expected Calibration Error, ECE). Bu metrik, güven aralıklarına (confidence bins) bölünmüş örneklerde ortalama güven ile ortalama doğruluk arasındaki mutlak farkı, her kutudaki örnek sayısıyla ağırlıklandırarak tek bir sayıya indirger. Maximum Calibration Error (MCE) ise en kötü kutudaki sapmayı raporlar ve güvenlik açısından hassas senaryolarda tercih edilir. Reliability diagram (güvenilirlik diyagramı) görsel değerlendirme aracıdır: yatay eksende tahmin güveni, dikey eksende gözlemlenen doğruluk yer alır ve ideal kalibrasyon 45 derecelik köşegen çizgiyle temsil edilir. Modelin eğrisi bu çizginin altında kalıyorsa, yani gözlemlenen doğruluk beyan edilen güvenden düşükse model aşırı güvenli (overconfident); üzerindeyse düşük güvenli (underconfident) demektir. Kalibrasyon bozukluğunu gidermek için modeli yeniden eğitmeyen post-hoc yöntemler kullanılır. Platt Scaling, ham skorları lojistik regresyonla olasılığa dönüştürür; Temperature Scaling, softmax girdisi olan logitleri tek bir skaler parametreye (T) bölerek dağılımı yumuşatır ya da keskinleştirir ve çoğu derin ağda daha basit olmasına rağmen daha iyi genelleşir; Isotonic Regression ise parametrik varsayım yapmadan monoton bir eşleme öğrenir. Bu yöntemlerin tümü küçük bir doğrulama kümesi üzerinde dakikalar içinde uygulanabildiğinden üretim ortamında yaygın biçimde tercih edilir. Büyük dil modellerinde kalibrasyon, modelin kendi bilgisizliğini ne kadar dürüst temsil ettiğiyle ilgilidir; yanlış bilgiyi yüksek kesinlikle sunan bir model halüsinasyon riskini büyütür. Bu nedenle kalibrasyon ölçümü, LLM değerlendirme protokollerinde ve seçici tahmin (selective prediction) gibi 'bilmiyorum' deme mekanizmalarının tasarımında temel araçlardan biridir.