functions Perplexity nasıl hesaplanır?
Hesap iki adımdan oluşur. Önce model, test metnindeki her token için bir olasılık üretir ve bu olasılıkların logaritmalarının ortalaması alınır. Bu ortalamanın işareti çevrilince çapraz entropi (cross-entropy) elde edilir. Perplexity ise bu değerin üssüdür: doğal logaritma kullanıldıysa e üzeri çapraz entropi, ikilik taban kullanıldıysa 2 üzeri çapraz entropi. Sezgisel karşılığı şudur: perplexity 10 ise model her kelimede ortalama 10 eşit olasılıklı seçenek arasında kalmış gibi davranıyor. Kusursuz bir model 1'e yaklaşır, rastgele tahmin yapan bir model kelime dağarcığı boyutuna yaklaşır.
rule Perplexity değeri nasıl yorumlanır?
- check_circle Düşük perplexity daha iyidir: Model test metnini daha az şaşırarak tahmin ediyor demektir. Aynı veri ve aynı tokenizer ile ölçülen iki model arasında düşük olan genelde daha iyi dil modellemesi yapar.
- check_circle Mutlak değer tek başına anlam taşımaz: Perplexity kullanılan tokenizer'a, kelime dağarcığına ve test verisine bağlıdır. Farklı tokenizer kullanan iki modelin perplexity sayılarını doğrudan karşılaştırmak yanıltıcı olur.
- check_circle Aynı koşulda karşılaştırın: Anlamlı bir kıyas için aynı test kümesi, aynı tokenizasyon ve aynı bağlam uzunluğu kullanılmalıdır. Pratikte WikiText-2 gibi standart kümeler bu yüzden tercih edilir.
- check_circle Kullanıcı memnuniyetini ölçmez: Perplexity metnin doğruluğunu, faydasını veya talimatlara uyumu ölçmez. Sohbet kalitesi için MMLU benzeri yetenek testleri ve insan değerlendirmesi gerekir.
lab_profile Perplexity pratikte nerelerde kullanılır?
- check_circle Niceleme kaybını ölçmek: Bir modeli 4 bit veya 8 bite indirdiğinizde kalite ne kadar bozuldu sorusunun standart cevabı perplexity farkıdır. llama.cpp gibi araçlar niceleme sonrası bu değeri raporlar.
- check_circle İnce ayar takibi: Eğitim sırasında doğrulama kümesindeki perplexity izlenir. Değer düşmeyi bırakıp yükselmeye başlarsa model ezberlemeye (overfitting) geçmiş olabilir.
- check_circle Yapay zeka yazı dedektörleri: GPTZero gibi araçlar, makine üretimi metinlerin genelde daha düşük perplexity taşıdığı varsayımını kullanır. Tek başına güvenilir bir kanıt değildir, cümle uzunluğu değişkenliğiyle birlikte değerlendirilir.
- check_circle Alan uyarlaması kontrolü: Tıp veya hukuk gibi özel bir alanda modelin o alandaki metinlerde ölçülen perplexity'si, modelin o alanı ne kadar tanıdığına dair hızlı bir gösterge verir.
warning Karşılaştırmada Dikkat Edilecek Kısıtlar
- check_circle Tokenizer bağımlılığı: Perplexity değeri kullanılan tokenizer'a doğrudan bağlıdır. Aynı metni farklı sayıda token'a bölen iki tokenizer, aynı modelde bile farklı perplexity üretir. Bu yüzden Llama tokenizer ile hesaplanan bir değeri GPT tokenizer sonuçlarıyla karşılaştırmak yanıltıcıdır.
- check_circle Test kümesi kalitesi: Eğitim verisiyle örtüşen test kümeleri perplexity değerini yapay olarak düşürür. Kontaminasyon testi yapılmadan yayımlanan benchmark sonuçlarına temkinli yaklaşılmalıdır.
- check_circle Bağlam uzunluğu etkisi: Modelin eğitildiği bağlam penceresinden daha uzun dizilerde ölçüm yapılırsa perplexity artar; bu modelin yetersizliğinden değil, mimarinin doğal sınırından kaynaklanır.
- check_circle Görev başarısını yansıtmaz: Düşük perplexity'ye sahip bir model MMLU veya HumanEval gibi testlerde düşük puanlayabilir. Görev performansı için ayrıca yetenek benchmark'ları kullanılmalıdır.
compare İlgili Metrikler ve Farkları
- check_circle Çapraz Entropi (Cross-Entropy): Perplexity'nin logaritmik temelidir. Aralarındaki ilişki: PPL = exp(CE). Eğitim sırasında optimize edilen kayıp fonksiyonu çapraz entropidir; perplexity onun daha sezgisel yorumlanabilen üstel dönüşümüdür.
- check_circle Bit/Karakter (BPC): Karakter düzeyinde modeller için kullanılan ve çapraz entropinin log2 tabanlı versiyonudur. Tokenizer bağımsız olduğu için farklı kelime dağarcıklı modellerin karşılaştırılmasında daha adil bir seçenektir.
- check_circle BLEU / ROUGE: Çeviri ve özetleme gibi üretim görevleri için n-gram örtüşme oranına dayalı metriklerdir. Perplexity dağılım kalitesini ölçtüğü için bu metrikler farklı amaçlara hizmet eder.
help Sık Sorulan Sorular
- check_circle Perplexity nedir, kısaca ne demek? Bir dil modelinin metni tahmin ederken ne kadar şaşırdığını gösteren sayıdır. Düşük değer modelin metni iyi öngördüğü, yüksek değer zorlandığı anlamına gelir.
- check_circle İyi bir perplexity değeri kaçtır? Evrensel bir eşik yoktur. Değer test verisine ve tokenizer'a göre değişir; bu yüzden yalnızca aynı koşulda ölçülen modeller karşılaştırılır. Büyük modern modeller standart İngilizce kümelerde genelde tek haneli değerlere iner.
- check_circle Perplexity ile accuracy arasındaki fark nedir? Accuracy doğru bilinen cevapların oranını ölçer ve sınıflandırma görevlerine uygundur. Perplexity ise modelin olasılık dağılımının kalitesini ölçer; doğru cevabı bilmese bile ona ne kadar yüksek olasılık verdiğini dikkate alır.
- check_circle Perplexity AI ile aynı şey mi? Hayır. Perplexity burada bir ölçüm metriğidir. Perplexity AI ise yapay zeka destekli arama motoru geliştiren şirketin adıdır; iki kavramın tek ortak noktası isim benzerliğidir.
- check_circle Farklı modellerin perplexity değerleri karşılaştırılabilir mi? Yalnızca aynı tokenizer, aynı test kümesi ve aynı bağlam uzunluğu kullanıldığında. Farklı tokenizer'larla elde edilen mutlak sayılar karşılaştırılamaz; bunun yerine BPC (bits-per-character) gibi tokenizer'dan bağımsız metrikler kullanılabilir.