tag Metrik
Perplexity (Şaşkınlık (Perplexity))
Bu sayfada Metrik (Perplexity (Şaşkınlık (Perplexity))) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Perplexity (şaşkınlık), bir dil modelinin belirli bir test metnini ne kadar iyi tahmin edebildiğini ölçen temel bir değerlendirme metriğidir. Model metindeki her token için bir olasılık dağılımı üretir; doğru token'a yüksek olasılık atadığında perplexity düşer, belirsiz veya yanlış tahminler yaptığında yükselir. Düşük perplexity, modelin metni daha az şaşırarak tahmin ettiği anlamına gelir. Matematiksel olarak perplexity, çapraz entropinin (cross-entropy loss) üsselidir. N token içeren bir test metninde hesaplama şöyle yapılır: Her token için bir önceki bağlama dayanılarak olasılık üretilir, bu olasılıkların negatif logaritmalarının ortalaması çapraz entropiyi verir, çapraz entropinin üsseliği ise perplexity değerini verir. Sezgisel yorum şöyledir: perplexity 50 ise model her kelimede ortalama 50 eşit olasılıklı seçenek arasında kalmış gibi davranmaktadır. Mükemmel tahmin 1 değerine, tamamen rastgele tahmin ise kelime dağarcığı boyutuna (on binlerce) yaklaşır. Perplexity özellikle üç alanda standart ölçüm aracı olarak kullanılır. Niceleme (quantization) kaybı değerlendirmesinde, 4-bit veya 8-bit sıkıştırma sonrası modelin orijinaline ne kadar yakın kaldığı WikiText-2 veya C4 gibi standart kümelerde ölçülür; llama.cpp ve AutoGPTQ gibi araçlar bu değeri otomatik raporlar. İnce ayar (fine-tuning) izlemesinde, doğrulama kümesindeki perplexity düşmeyi bırakıp yükselmeye başlarsa modelin ezberlemeye (overfitting) girdiğine işaret eder. Alan uyarlaması kontrolünde ise tıp veya hukuk gibi özel alanlardaki metinlerde ölçülen perplexity, modelin o alanı tanıma düzeyinin hızlı bir göstergesidir. Temel bir kısıt: perplexity tokenizer'a bağlıdır ve farklı kelime dağarcıklı modellerin mutlak değerleri karşılaştırılamaz. Aynı koşullarda ölçülmesi gereken bu metrik, metnin doğruluğunu, faydasını veya talimata uyumunu ölçmez; sohbet kalitesi için ayrıca MMLU ve HumanEval gibi yetenek benchmark'ları kullanılır. Günümüzde büyük dil modellerinin WikiText-2 kümesindeki perplexity değerleri tek haneli rakamlara inmiş olup bu, on yıl öncesine kıyasla devasa bir ilerlemeyi yansıtır.
Perplexity (Şaşkınlık (Perplexity))
Perplexity (şaşkınlık), bir dil modelinin belirli bir test metnini ne kadar iyi tahmin edebildiğini ölçen temel bir değerlendirme metriğidir. Model metindeki her token için bir olasılık dağılımı üretir; doğru token'a yüksek olasılık atadığında perplexity düşer, belirsiz veya yanlış tahminler yaptığında yükselir. Düşük perplexity, modelin metni daha az şaşırarak tahmin ettiği anlamına gelir. Matematiksel olarak perplexity, çapraz entropinin (cross-entropy loss) üsselidir. N token içeren bir test metninde hesaplama şöyle yapılır: Her token için bir önceki bağlama dayanılarak olasılık üretilir, bu olasılıkların negatif logaritmalarının ortalaması çapraz entropiyi verir, çapraz entropinin üsseliği ise perplexity değerini verir. Sezgisel yorum şöyledir: perplexity 50 ise model her kelimede ortalama 50 eşit olasılıklı seçenek arasında kalmış gibi davranmaktadır. Mükemmel tahmin 1 değerine, tamamen rastgele tahmin ise kelime dağarcığı boyutuna (on binlerce) yaklaşır. Perplexity özellikle üç alanda standart ölçüm aracı olarak kullanılır. Niceleme (quantization) kaybı değerlendirmesinde, 4-bit veya 8-bit sıkıştırma sonrası modelin orijinaline ne kadar yakın kaldığı WikiText-2 veya C4 gibi standart kümelerde ölçülür; llama.cpp ve AutoGPTQ gibi araçlar bu değeri otomatik raporlar. İnce ayar (fine-tuning) izlemesinde, doğrulama kümesindeki perplexity düşmeyi bırakıp yükselmeye başlarsa modelin ezberlemeye (overfitting) girdiğine işaret eder. Alan uyarlaması kontrolünde ise tıp veya hukuk gibi özel alanlardaki metinlerde ölçülen perplexity, modelin o alanı tanıma düzeyinin hızlı bir göstergesidir. Temel bir kısıt: perplexity tokenizer'a bağlıdır ve farklı kelime dağarcıklı modellerin mutlak değerleri karşılaştırılamaz. Aynı koşullarda ölçülmesi gereken bu metrik, metnin doğruluğunu, faydasını veya talimata uyumunu ölçmez; sohbet kalitesi için ayrıca MMLU ve HumanEval gibi yetenek benchmark'ları kullanılır. Günümüzde büyük dil modellerinin WikiText-2 kümesindeki perplexity değerleri tek haneli rakamlara inmiş olup bu, on yıl öncesine kıyasla devasa bir ilerlemeyi yansıtır.
Precision-Recall (Kesinlik-Duyarlılık)
Precision (Kesinlik) ve Recall (Duyarlılık), makine öğrenmesinde sınıflandırma modellerinin performansını değerlendirmek için kullanılan iki temel ölçüttür. Her ikisi de Confusion Matrix üzerinden türetilir ve birbirini tamamlayan iki farklı bakış açısını yansıtırken aynı zamanda uygulamanın gereksinimlerine göre farklı öncelikler taşır. Precision formülü: TP / (TP + FP). Model "Evet" dediği tahminler arasında gerçekten doğru olanların oranıdır. Örneğin spam tespitinde yüksek Precision, meşru e-postaların yanlışlıkla spam klasörüne atılmadığını güvence altına alır. Düşük Precision, sistemin fazla sayıda yanlış alarm ürettiğini gösterir ve kullanıcı deneyimini olumsuz etkiler. Recall formülü: TP / (TP + FN). Tüm gerçek pozitif örnekler arasında modelin doğru yakaladıklarının oranıdır. Tıbbi teşhiste yüksek Recall, hasta bireylerin gözden kaçırılmadığını garantiler. Düşük Recall, sistemin gerçek pozitiflerin önemli bir bölümünü atladığını ve ciddi sonuçlara yol açabileceğini gösterir. Precision-Recall Dengesi (Trade-off): İki ölçüt birbiriyle ters orantılıdır. Model eşik değeri düşürüldüğünde daha fazla pozitif tahmin yapılır, Recall yükselirken Precision düşer. Eşik yükseltildiğinde tam tersi gerçekleşir. Hangi dengenin tercih edileceği, uygulamanın kaçırma maliyetine ve yanlış alarm maliyetine bağlıdır. F1-Score ve AUC-PR: İki ölçütü tek değerde özetlemek için harmonik ortalamayı kullanan F1-Score tercih edilir: 2 × (Precision × Recall) / (Precision + Recall). Precision-Recall Eğrisi (PR Curve), farklı eşiklerdeki dengeyi görselleştirir; eğrinin altındaki alan (AUC-PR) özellikle dengesiz (imbalanced) veri kümelerinde ROC-AUC'a göre daha bilgilendirici bir genel performans göstergesidir. LLM ve RAG sistemlerinde Precision@k ile Recall@k metrikleri, geri çekilen ilk k belge arasında kaçının alaka düzeyinde olduğunu ve tüm alakalı belgelerin ne kadarının döndürüldüğünü ölçer. RAGAS ve TruLens gibi RAG değerlendirme çerçeveleri bu ölçütleri merkeze alır ve boru hattının retrieval kalitesini sistematik biçimde izler.