İngiltere AISI ve EvalEval, Yapay Zeka Kıyaslamalarını Tekrar Üretilebilir Hale Getiriyor
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) ve EvalEval koalisyonu, yapay zeka değerlendirme sonuçlarının şeffaf ve tekrar üretilebilir olması için ortak altyapı geliştiriyor. İşbirliği, Every Eval Ever şeması ve Evaluation Cards platformuyla sektörde standartlaşmayı hedefliyor.
Yapay Zeka Değerlendirmelerinde Şeffaflık Sorunu
Yapay zeka sistemlerinin yeteneklerini ölçmek için kullanılan kıyaslama testleri (benchmark), model performansı hakkında önemli kanıtlar sunuyor. Ancak bu sonuçlar farklı formatlarda, platformlarda ve yayın organlarında raporlanıyor; çoğu zaman sonuçları tekrar üretmek için gereken ayrıntılar eksik kalıyor. Üstelik değerlendirmeleri yeniden çalıştırmak başlı başına yüksek maliyetli olabiliyor.
İngiltere Yapay Zeka Güvenlik Enstitüsü (UK AI Security Institute – AISI) ve EvalEval koalisyonu, bu dağınık tabloyu düzeltmek için güçlerini birleştirdi. İki kurum daha önce NeurIPS 2025 kapsamında düzenlenen ortak bir çalıştayda bir araya gelmiş, AISI'den gelen geri bildirimler Every Eval Ever (EEE) şemasının şekillenmesine katkı sağlamıştı. Şimdi işbirliğinin yeni aşaması, bu ortak altyapıyı pratiğe döküyor.
Every Eval Ever ve Evaluation Cards Nedir?
EvalEval'in misyonu, değerlendirme ekosistemini iyileştirmek için iki temel araç geliştirmek üzerine kurulu:
- Every Eval Ever (EEE): Değerlendirme sonuçlarının paylaşıldığı ortak bir raporlama şeması. Bu şema, farklı kaynaklardan gelen verilerin aynı yapı içinde karşılaştırılabilmesini amaçlıyor.
- Evaluation Cards: Değerlendirme sonuçlarını, bu sonuçları yorumlamak için gereken bağlam bilgisiyle birlikte ortak bir yapıda sunan açık platform.
Bu iki proje bir arada, görünüşte benzer olan puanların aslında anlamlı biçimde farklı koşullar altında üretilip üretilmediğini anlamayı kolaylaştırıyor. EEE şeması, kıyaslama üstverisi (metadata), değerlendirme çalıştırma verileri ve model üstverisini yorumlanabilir kayıtlara dönüştürüyor.
AISI'nin Açık Veri Katkısı
İşbirliğinin bu yeni aşamasında AISI, kamuya açık olarak raporlanan değerlendirme yöntemlerini ve bulgularını uygun olduğu yerlerde Evaluation Cards aracılığıyla erişime sunuyor. Yayınlanan veri seti, AISI'nin *How Inference Compute Shapes Frontier LLM Evaluation* başlıklı makalesinin ana deneyinde kullanılan beş kıyaslama testine ait doğrulanmış sonuçları, bağlamı ve yapılandırma bilgilerini içeriyor:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Bu sonuçlar altı öncü modeli kapsıyor: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 ve GPT-5.4. Ayrıca iki ilgili siber güvenlik değerlendirmesinden (Cyber CTFs ve The Last Ones) gelen ve kısmen örtüşen farklı bir model kümesini kullanan sonuçlar da paylaşılıyor.
Çıkarım Hesaplaması ve Protokolün Etkisi
AISI'nin makalesi, kıyaslama performansının çıkarım zamanındaki hesaplama gücüne (inference-time compute) ve değerlendirme protokolüne nasıl bağlı olduğunu inceliyor. Örneğin Humanity's Last Exam performansı, değerlendirme protokolüne ve çıkarım hesaplamasına göre değişiklik gösteriyor.
Her eğri, belirli bir token sayısı içinde çözülen görevlerin kümülatif payını gösteriyor ve her görev için gözlemlenen en erken başarıyı temel alıyor. Modeller her denemeden sonra bir oracle'dan doğruluk geri bildirimi aldığında, token kullanımı arttıkça ek görevleri çözmeye devam ediyorlar. Bu, değerlendirme koşullarının sonuçlar üzerinde ne kadar belirleyici olabileceğini gözler önüne seriyor.
Sonuçlar kurulum bilgileriyle birlikte açıkça paylaşıldığında, araştırmacılar ve uygulayıcılar tek tek çalışmaları daha yakından inceleyebiliyor ve bulguları daha geniş ekosistemle karşılaştırabiliyor. Diğer raporlar bu ayrıntılardan yoksun kaldığında, AISI gibi kurumların yayınları değerlendirmeleri bağlamı içinde yorumlamak için doğrulanmış referans noktaları sağlıyor. Örneğin araştırmacılar, kurulum tercihlerinin bildirilen performansı nasıl etkileyebileceğini bu sayede anlayabiliyor.
EvalEval Koalisyonu ve Gelecek Planları
EvalEval Coalition, değerlendirme ekosistemi için bilimsel temelli araştırma ve sağlam dağıtım altyapısı geliştiren bir araştırma topluluğu. Amacı, değerlendirme bilimini ilerletmek, değerlendirmelerin uygulanabilirliği ve faydasının belgelenmesi konusundaki fikir ayrılıklarını gidermek ve bilimsel araştırma ile politika analizi için önem taşıyan etkilerin kapsamını genişletmek.
Koalisyonun amiral gemisi projeleri arasında, değerlendirme sonuçları için ortak bir şema ve depo olan Every Eval Ever ile kıyaslama üstverisini, değerlendirme çalıştırma verilerini ve model üstverisini yorumlanabilir kayıtlarda birleştiren Evaluation Cards yer alıyor. Daha fazla değerlendirici EEE'yi benimsedikçe, bu tür açık karşılaştırmalar daha geniş ve güvenilir meta-araştırmayı destekleyebilir.
AISI'nin Terminal-Bench 2.0 sonuçları, aynı modeller için farklı değerlendirme kurulumları altında bildirilen diğer değerlendirmelerle yan yana getirildiğinde bu etki daha net görülüyor.
Neden Önemli?
Yapay zeka modellerinin yeteneklerine dair kamuoyu ve politika tartışmaları giderek daha fazla kıyaslama sonuçlarına dayanıyor. Ancak bu sonuçların hangi koşullar altında elde edildiği bilinmediğinde, karşılaştırmalar yanıltıcı olabiliyor. AISI ve EvalEval işbirliği, değerlendirme raporlamasında şeffaflığı ve tekrar üretilebilirliği artırarak bu sorunu çözmeyi hedefliyor.
Türkiye'deki yapay zeka araştırmacıları, model geliştiricileri ve politika yapıcıları için bu gelişme birkaç açıdan önem taşıyor. Öncelikle, açık ve standart bir şema sayesinde yerel ekipler kendi değerlendirme sonuçlarını uluslararası bağlamda konumlandırabilir. İkincisi, değerlendirme maliyetlerinin yüksek olduğu bir ortamda, doğrulanmış referans noktalarına erişim kaynak israfını azaltabilir. Üçüncüsü, şeffaf raporlama, yapay zeka güvenliği ve yönetişimi konusunda bilimsel temelli politikalar geliştirmek isteyen kurumlar için sağlam bir zemin oluşturuyor.
EvalEval, model geliştiricilerini doğrulanmış değerlendirme sonuçlarını raporlamaya, değerlendirme geliştiricilerini Every Eval Ever şemasını kullanmaya, araştırmacıları ise Evaluation Cards'ı keşfetmeye davet ediyor. Bu tür ortak çabalar yaygınlaştıkça, yapay zeka değerlendirmeleri daha güvenilir ve karşılaştırılabilir hale gelecek; bu da hem bilimsel ilerleme hem de sorumlu yapay zeka kullanımı için kritik önemde.