tag Model Kalitesi

Bu sayfada Model Kalitesi etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.

Perplexity (şaşkınlık), bir dil modelinin belirli bir test metnini ne kadar iyi tahmin edebildiğini ölçen temel bir değerlendirme metriğidir. Model metindeki her token için bir olasılık dağılımı üretir; doğru token'a yüksek olasılık atadığında perplexity düşer, belirsiz veya yanlış tahminler yaptığında yükselir. Düşük perplexity, modelin metni daha az şaşırarak tahmin ettiği anlamına gelir. Matematiksel olarak perplexity, çapraz entropinin (cross-entropy loss) üsselidir. N token içeren bir test metninde hesaplama şöyle yapılır: Her token için bir önceki bağlama dayanılarak olasılık üretilir, bu olasılıkların negatif logaritmalarının ortalaması çapraz entropiyi verir, çapraz entropinin üsseliği ise perplexity değerini verir. Sezgisel yorum şöyledir: perplexity 50 ise model her kelimede ortalama 50 eşit olasılıklı seçenek arasında kalmış gibi davranmaktadır. Mükemmel tahmin 1 değerine, tamamen rastgele tahmin ise kelime dağarcığı boyutuna (on binlerce) yaklaşır. Perplexity özellikle üç alanda standart ölçüm aracı olarak kullanılır. Niceleme (quantization) kaybı değerlendirmesinde, 4-bit veya 8-bit sıkıştırma sonrası modelin orijinaline ne kadar yakın kaldığı WikiText-2 veya C4 gibi standart kümelerde ölçülür; llama.cpp ve AutoGPTQ gibi araçlar bu değeri otomatik raporlar. İnce ayar (fine-tuning) izlemesinde, doğrulama kümesindeki perplexity düşmeyi bırakıp yükselmeye başlarsa modelin ezberlemeye (overfitting) girdiğine işaret eder. Alan uyarlaması kontrolünde ise tıp veya hukuk gibi özel alanlardaki metinlerde ölçülen perplexity, modelin o alanı tanıma düzeyinin hızlı bir göstergesidir. Temel bir kısıt: perplexity tokenizer'a bağlıdır ve farklı kelime dağarcıklı modellerin mutlak değerleri karşılaştırılamaz. Aynı koşullarda ölçülmesi gereken bu metrik, metnin doğruluğunu, faydasını veya talimata uyumunu ölçmez; sohbet kalitesi için ayrıca MMLU ve HumanEval gibi yetenek benchmark'ları kullanılır. Günümüzde büyük dil modellerinin WikiText-2 kümesindeki perplexity değerleri tek haneli rakamlara inmiş olup bu, on yıl öncesine kıyasla devasa bir ilerlemeyi yansıtır.

search

Perplexity (Şaşkınlık (Perplexity))

Perplexity (şaşkınlık), bir dil modelinin belirli bir test metnini ne kadar iyi tahmin edebildiğini ölçen temel bir değerlendirme metriğidir. Model metindeki her token için bir olasılık dağılımı üretir; doğru token'a yüksek olasılık atadığında perplexity düşer, belirsiz veya yanlış tahminler yaptığında yükselir. Düşük perplexity, modelin metni daha az şaşırarak tahmin ettiği anlamına gelir. Matematiksel olarak perplexity, çapraz entropinin (cross-entropy loss) üsselidir. N token içeren bir test metninde hesaplama şöyle yapılır: Her token için bir önceki bağlama dayanılarak olasılık üretilir, bu olasılıkların negatif logaritmalarının ortalaması çapraz entropiyi verir, çapraz entropinin üsseliği ise perplexity değerini verir. Sezgisel yorum şöyledir: perplexity 50 ise model her kelimede ortalama 50 eşit olasılıklı seçenek arasında kalmış gibi davranmaktadır. Mükemmel tahmin 1 değerine, tamamen rastgele tahmin ise kelime dağarcığı boyutuna (on binlerce) yaklaşır. Perplexity özellikle üç alanda standart ölçüm aracı olarak kullanılır. Niceleme (quantization) kaybı değerlendirmesinde, 4-bit veya 8-bit sıkıştırma sonrası modelin orijinaline ne kadar yakın kaldığı WikiText-2 veya C4 gibi standart kümelerde ölçülür; llama.cpp ve AutoGPTQ gibi araçlar bu değeri otomatik raporlar. İnce ayar (fine-tuning) izlemesinde, doğrulama kümesindeki perplexity düşmeyi bırakıp yükselmeye başlarsa modelin ezberlemeye (overfitting) girdiğine işaret eder. Alan uyarlaması kontrolünde ise tıp veya hukuk gibi özel alanlardaki metinlerde ölçülen perplexity, modelin o alanı tanıma düzeyinin hızlı bir göstergesidir. Temel bir kısıt: perplexity tokenizer'a bağlıdır ve farklı kelime dağarcıklı modellerin mutlak değerleri karşılaştırılamaz. Aynı koşullarda ölçülmesi gereken bu metrik, metnin doğruluğunu, faydasını veya talimata uyumunu ölçmez; sohbet kalitesi için ayrıca MMLU ve HumanEval gibi yetenek benchmark'ları kullanılır. Günümüzde büyük dil modellerinin WikiText-2 kümesindeki perplexity değerleri tek haneli rakamlara inmiş olup bu, on yıl öncesine kıyasla devasa bir ilerlemeyi yansıtır.

arrow_forward