Yapay Zeka Ajanlarında Tutarlılık Sorunu: Ortalamaların Gizlediği Gerçek — yapay zeka haberi
newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 16 Eylül 2026 · 02:31 timer 7 dk okuma

Yapay Zeka Ajanlarında Tutarlılık Sorunu: Ortalamaların Gizlediği Gerçek

HuggingFace araştırmacıları, yapay zeka ajanlarının ortalama başarısının arkasında ciddi bir tutarsızlık sorunu olduğunu ortaya koydu. Yeni geliştirilen Tutarlılık Analizcisi ve tutarlılık yönergeleri, bu açığı yarıya indiriyor.

Ortalamaların Gizlediği Sorun

Yapay zeka ajanları (AI agents) artık karmaşık görevleri yerine getirebiliyor. Peki aynı görevi tekrar sorduğunuzda aynı başarıyı gösterecekler mi? HuggingFace araştırmacılarının yayımladığı yeni bir çalışma, bu sorunun cevabının sanıldığı kadar net olmadığını gösteriyor.

Bir gösteri sırasında ajanın başarısız olması utanç verici olabilir. Ancak üretim ortamında bu durum çok daha ciddi bir güvenilirlik sorununa dönüşüyor: bir kez başarıyla tamamlanan iş akışı, kullanıcı aynı isteği tekrarladığında başarısız olabiliyor. Finansal bir işlemin mutabakatı ya da bir sözleşmedeki yükümlülüğün kontrol edilmesi gibi kritik görevlerde bu durum projeyi durdurabilecek bir engel haline geliyor.

Çoğu kıyaslama (benchmark) bu değişkenliği bir ortalamanın arkasına saklıyor. AppWorld üzerinde GPT-4.1 kullanan bir ReAct ajanı, beş tekrarlı çalışmanın %77,4'ünde başarılı oldu. Ancak görevlerin yalnızca %53,0'ünde beş çalışmanın tamamında başarı sağladı. Bu, 24,4 puanlık bir tutarlılık açığı (consistency gap) anlamına geliyor. Çoğu kıyaslama ilk sayıyı raporluyor; araştırmacılar ise ikinciyi ölçmenin ve iyileştirmenin yolunu geliştirdi.

Tutarlılık Açığı Nedir?

Standart ajan değerlendirmesi Mean@k değerini raporlar: bir kıyaslamayı k kez çalıştırıp geçme oranının ortalamasını alırsınız. Genellikle k=3, bazen k=1 olur. Her liderlik tablosunda gördüğünüz sayı budur ve "%77 doğruluk" pratikte bunu ifade eder.

Ancak Mean@k şu soruyu yanıtlar: "Bu ajan ortalama olarak ne kadar iyi?" Gerçek bir kullanıcının önemsediği soruyu yanıtlamaz: "Aynı soruyu tekrar sorarsam yine iyi olacak mı?" Bunun için Pass^k değerine ihtiyacınız var: ajanın k çalışmanın tamamında başarılı olduğu görevlerin oranı.

Pass^k, Pass@k ile karıştırılmamalı. Alışıldık Pass@k iyimserdir; k denemenin en az birinin başarılı olup olmadığını sorar. Pass^k ise kötümser aynasıdır: her deneme başarılı olmalıdır. Her zaman Pass^k ≤ Mean@k ≤ Pass@k geçerlidir.

GPT-4.1 destekli bir ReAct ajanı %77,4'lük Mean@5 değeriyle gerçekten güçlü bir performans sergiliyor. Ancak Pass^5 yalnızca %53,0. Kıyaslamanın neredeyse dörtte biri, ajanın bazen çözebildiği bazen çözemediği görevlerden oluşuyor; üstelik görevler arasında hiçbir şey değişmiyor. Mean@k eksi Pass^k farkına "tutarlılık açığı" deniyor.

Bu, daha büyük bir modelle çözülecek bir yetenek sorunu değil. Bu dik bir eksen: bir ajan hem yetenekli hem de tutarsız olabilir.

Kararsız Karar Noktaları

Bir büyük dil modeli (LLM) ajanı her karar verdiğinde — hangi API'yi çağıracağı, hangi argümanı geçireceği, yeniden denemesi gerekip gerekmediği — bu karar bir sonraki token'lar üzerindeki olasılık dağılımından çıkar. Önemli olan bu dağılımın şeklidir.

Keskin bir dağılım kütlesinin çoğunu tek bir token'a yığar; aynı seçim her çalışmada tekrar eder. Düz bir dağılım ise birbirine yakın birkaç token arasında benzer kütle dağıtır ve hangisinin kazanacağı neredeyse yazı tura atışına dönüşür. Bu şekil, sonucu değiştirmek için ne kadar gürültü gerektiğini belirler.

Keskin dağılımlar dayanıklıdır: GPU kayan nokta işlemlerinin birleşme özelliğinin olmaması, istek gruplama ve diğer platform etkileri sayıları hafifçe oynatır ama net bir kazananı yeniden sıralamaya yetmez. Düz dağılımlar ise tam da bu oynamalara karşı savunmasızdır; yakın beraberlikler küçük bozulmalarla tersine dönebilir. Bir yörünge düzinelerce kararı zincirlediği için, adım başına küçük bir sapma olasılığı, bir çalışmanın farklı sonuçlanması ihtimaline dönüşerek büyür. 24 puanlık açık tam da buradan doğar.

Bu sorunun kod çözme ayarlarıyla çözülememesinin nedeni de bu. Açgözlü kod çözme (greedy decoding) ve sabit tohum (fixed seed), bir dağılımın token'a nasıl dönüştüğünü yönetir; dağılımın kendisi hakkında hiçbir şey söylemez. Barındırılan bir uç noktada olasılıklar çalışmadan çalışmaya hafifçe kayar; bu yüzden sıfır sıcaklıkta aynı modele aynı istem, bir yakın beraberliği bugün bir yöne, yarın diğer yöne çözebilir. Araştırmacıların kurulumunda ReAct ajanı 0,0 sıcaklıkta çalışıyor; yani yukarıdaki varyansın hiçbiri sıradan örneklemeden kaynaklanmıyor.

Tutarlılık Analizcisi ve Yönergeler

Bu, sorunu bir aramaya dönüştürüyor: belirli bir yörüngedeki hangi adımlar düz dağılımlıydı ve bunu öğrendikten sonra ne yapmalı?

Tutarlılık yönergeleri, ALTK-Evolve'ün mevcut altyapısına eklemlenen iki aşamalı bir hattan çıkıyor. İlk aşama tespit: Tutarlılık Analizcisi (Consistency Analyzer). Kaydedilmiş tek bir yörünge verildiğinde analizci, her karar adımını kontrollü yeniden örnekleme ile yeniden oynatır ve modelin çıktısının o noktada gerçekte ne kadar değiştiğini ölçer. Somut olarak bu, karar adımı başına bir ek model çağrısıdır; çevrimdışı bir kez yapılır ve örnekleme parametresi k tamamlama çekecek şekilde ayarlanır (varsayılan k=5). Yeni araç çağrıları, yeni ortam etkileşimleri veya görevin ikinci bir uçtan uca çalıştırması söz konusu değildir. Bu, karar adımı başına bir tutarlılık puanı üretir ve hangi kararların bir sonraki çalışmada ters dönme riski taşıdığını tam olarak gösteren bir puan kartına yazılır. Tespit tamamen kara kutudur: logit yok, model iç yapısı yok, elinizdeki izin ötesinde bir enstrümantasyon yok.

İkinci aşama üretim: hedefli yönergeler. İşaretlenen her adım, standart ALTK-Evolve formatında bir tutarlılık yönergesi adayına dönüşür ve mevcut depolama ile geri getirme hattına yerleşir. GPT-4.1 tarafından AppWorld'ün "SimpleNote notuma göre yapılacaklar listemde kaç etkinlik var?" görevinden üretilen gerçek bir örnek şöyle: not içeriğindeki onay kutusu tarzı işaretleri sayarken düz alt dize sayımı yerine satıra bağlı düzenli ifade eşleşmesi kullanın, çünkü not başlıkları işaret sembolünü bir açıklama satırında sıkça tekrarlar. İkinci yönerge ise not sorgularında arama sonuçlarını her zaman birden fazla eşleşme açısından doğrulayın ve devam etmeden önce doğru notu teyit edin diyor.

Buradaki hiçbir şey göreve özgü ayrıntı değil. Dize sayma hataları ve doğrulanmamış arama sonuçları, birçok AppWorld görevinde yüksek belirsizlikle ortaya çıkan karar noktalarıdır. Analizcinin hedefi başarısızlık değil kararsızlıktır; yani ajanın bu sefer doğru yaptığı ama bir sonraki sefer kolayca yanlış yapabileceği adımları yakalar.

Sonuçlar ve Genelleme

Değerlendirme, AppWorld test_normal (168 görev) üzerinde GPT-4.1 ile çalışan bir ReAct ajanıyla yapıldı; her görev için tek bir temel yörüngeden tutarlılık yönergeleri üretildi ve bunlar 5 yeni çalışmada test edildi.

Tutarlılık açığı kabaca yarıya indi. Toplam Pass^5 %53,0'dan %69,0'a yükselirken Mean@5 %77,4'ten %81,0'a çıktı; "yetenekli görünmek" ile "güvenilebilir olmak" arasındaki fark 24,4 puandan 12,0 puana daraldı. Önceden tutarsız olan görevlerin neredeyse üçte biri, ajanın her çalışmada geçtiği görevlere dönüştü.

Kazanç en çok orta ve zor katmanlarda görüldü. Orta katman +22,9 puan (göreli %44), zor katman +14,3 puan (göreli %45) kazandı; göreli olarak neredeyse başa baş, mutlak olarak orta katman önde. Kolay katman ise en az paya sahip olduğundan +12,2 puan kazandı. Bu, tutarlılık yönergelerinin tasarlandığı işi yaptığını gösteriyor: ajanın kendi belirsizliğinin sonuca sızdığı belirli karar noktalarını bulmak ve stabilize etmek.

Mean@5 hiçbir zaman düşmedi. Ortalama doğruluğu korumak "olsa iyi olur" değil, katı bir gereksinimdi; Mean@5'i feda ederek Pass^5'i artıran bir sistem güvenilmezliği düzeltmek yerine sadece yerini değiştirirdi. Ortalama doğruluk her zorluk seviyesinde korundu ya da iyileşti.

Yönergeler, çıkarıldıkları senaryonun farklı ama ilişkili bir görevine uygulandığında bile Pass^5'i +13,0 puan artırdı; bu, aynı görev sayısının yalnızca 3 puan altında. Tek bir çalışmadan türetilen bir yönerge sadece o çalışmayı yamamıyor; aktarılabilir bir şey yakalıyor.

Daha zayıf bir model olan gpt-oss-120b'den gelen kanıt ise daha çarpıcı. Aynı görevde Pass^5, çok daha düşük bir tabandan (10,1'den 16,1'e) +6,0 puan yükseldi. İlginç biçimde benzer görev genelleme sayısı (+8,7 puan) aynı görev kazancını aştı; bu, yönergelerin tek bir yörüngenin ayrıntılarını ezberlemek yerine gerçekten yeniden kullanılabilir başarısızlık kalıplarını yakaladığını düşündürüyor.

Neden Önemli?

Türkiye'deki yapay zeka ekipleri ve ürün geliştiricileri için bu çalışma, doğrudan üretim ortamına dokunan bir uyarı niteliğinde. Bir ajanı müşteri hizmetlerine, finansal işlem mutabakatına veya sözleşme analizine yerleştirdiğinizde, liderlik tablolarındaki ortalama doğruluk sayısı yanıltıcı olabilir. Kullanıcı aynı soruyu iki kez sorduğunda farklı sonuç alıyorsa, o ürün güvenilir değildir — ne kadar yüksek Mean@k raporlarsa raporlasın.

Buradaki en pratik çıkarım, değerlendirme kültürünü değiştirmek. Pass^k değerini Mean@k'nın yanında raporlamak, güvenilir bir ajanı şanslı olandan ayırmanın en basit yolu; k=3 bile bilmediğiniz bir açığı ortaya çıkarır. Açığın zorlukla birlikte genişlemesini beklemek de önemli: en zor katman, tek bir ortalamanın en yanıltıcı olduğu yerdir.

Daha da önemlisi, ilk refleks olarak daha büyük bir modele yönelmek doğru değil. Tutarlılık, yetenekten bağımsız bir eksen; daha güçlü bir model Mean@k'yı yükseltir ama tutarlılık açığını otomatik olarak daraltmaz. Analizcinin bir değerlendiriciye (grader) ve canlı yeniden oynatmaya ihtiyaç duymaması, onu üretim trafiğinde kullanılabilir kılıyor — çünkü çoğu zaman bir görevi uçtan uca bir kez bile yeniden çalıştıramazsınız. Karar adımı başına tek bir ek LLM çağrısı yeterli oluyor.

Araştırmacılar ALTK-Evolve araç setini açık kaynak olarak paylaştı; depo artık Tutarlılık Analizcisi'ni ve bu deneylerde kullanılan tutarlılık yönergesi üretimini içeriyor. Kendi görevlerinizde yeniden üretemediğiniz doğruluk sayıları tanıdık geliyorsa, bu tam da konuşulması gereken bir konu.

link Kaynak: HuggingFace
tag yapay zeka tag AI ajanları tag HuggingFace tag LLM tag güvenilirlik

İlgili Terimler

5 terim