OpenAI: İki API Ayarı ARC-AGI-3 Skorlarını Üçe Katladı — yapay zeka haberi
newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 30 Temmuz 2026 · 10:43 timer 3 dk okuma

OpenAI: İki API Ayarı ARC-AGI-3 Skorlarını Üçe Katladı

OpenAI, GPT-5.6 Sol'un ARC-AGI-3 benchmarkında düşük skorlar almasının nedenini araştırdı ve iki API ayarını (akıl yürütmeyi saklama ve sıkıştırma) etkinleştirmenin skorları üçe katladığını, çıktı token sayısını 6 kat azalttığını keşfetti. Bu bulgular, yapay zeka modellerinin değerlendirilmesinde API ayarlarının ve test düzeneklerinin kritik rolünü vurguluyor.

Düşük Skorların Şaşırtıcı Nedeni

OpenAI, gelişmiş yapay zeka modeli GPT-5.6 Sol'un ARC-AGI-3 benchmarkında yalnızca %7.8 skor alması karşısında şaşkına döndü. Oysa aynı model, matematikte döngü çift kapsama varsayımı (cycle double cover conjecture) gibi uzun süredir çözülemeyen problemleri çözmüş ve Pokémon FireRed gibi oyunları yenmişti. ARC-AGI-3 ise 2 boyutlu bulmaca oyunlarından oluşan bir benchmark; bu oyunlar, ajanların açık talimat olmadan keşif yaparak öğrenmesini ölçüyor. Peki neden bu kadar düşük skor? OpenAI, sorunun modelin kendisinden değil, test düzeneğindeki (harness) API ayarlarından kaynaklandığını keşfetti. ARC-AGI-3, kasıtlı olarak jenerik bir düzenek kullanıyor; bu, model kusurlarını daha görünür kılmak ve karşılaştırmaları adil yapmak için. Ancak ticari geliştiriciler, düzenekleri her modelin özelliklerine göre optimize ediyor. OpenAI, GPT-5.6 Sol'un Pokémon FireRed'de görüntü tabanlı bir düzenekle, Slay the Spire'da Codex bilgisayar kullanımıyla başarılı olduğunu hatırlattı. ARC-AGI-3'teki fark neydi?

Akıl Yürütmeyi Saklamanın Etkisi

ARC-AGI-3 test düzeneği, her oyun hamlesinden sonra modelin tüm özel akıl yürütme (private reasoning) mesajlarını siliyordu. Bu, modelin her seferinde oyunu sıfırdan anlamaya çalışmasına neden oluyordu. Model yalnızca geçmiş hamleleri ve kısa notları görebiliyor, ancak bu hamlelere yol açan planları, içgörüleri veya düşünceleri göremiyordu. OpenAI, ChatGPT ve Codex'te kullandıkları gibi akıl yürütmeyi saklama (retain reasoning) özelliğini etkinleştirdiğinde, modelin önceki düşüncelerini hatırlayabildiğini ve daha tutarlı stratejiler geliştirebildiğini gördü. Bu sayede model, her hamle öncesinde daha az düşünerek zamandan tasarruf etti ve öğrenme yeteneği belirgin şekilde arttı. OpenAI'nin Responses API'si, önceki yanıt kimliğini (response ID) ileterek akıl yürütmeyi otomatik olarak saklıyor. Bu, modelin her turda oyunu yeniden yorumlamak zorunda kalmamasını sağlıyor.

Sıkıştırma ile Bellek Yönetimi

Test düzeneğindeki bir diğer sorun, yuvarlanan kesme (rolling truncation) yöntemiydi. Konuşma geçmişi 175.000 karakteri aştığında en eski mesajlar atılıyordu. Bu, modelin erken gözlemlerini ve eylemlerini unutmasına yol açıyordu. Ayrıca model, görevin büyük kısmında daha dolu bir bağlam penceresiyle çalışıyordu; bu da performansı hafifçe düşürebiliyor. OpenAI, bunun yerine sıkıştırma (compaction) özelliğini kullandı. Sıkıştırma, geçmişi özetleyerek daha uzun süreli bağlam koruması sağlıyor. Bu değişiklikle model, oyun hakkında öğrendiklerini daha iyi muhafaza etti ve daha yüksek skor elde etti. OpenAI, sıkıştırma ile birlikte modelin daha az çıktı tokeni üreterek daha verimli çalıştığını gözlemledi.

Sonuçlar ve Öneriler

Akıl yürütmeyi saklama ve sıkıştırma ayarlarının birlikte kullanılması, GPT-5.6 Sol'un ARC-AGI-3 skorunu yaklaşık 3 kat artırırken, çıktı token sayısını 6 kat azalttı. OpenAI, bu deneyimin, değerlendirmelerin (evals) modelleri tek başına ölçmediğini, aynı zamanda API ayarları, test düzeneği tasarımı ve yönlendirme (prompting) gibi daha az görünür seçimleri de yansıttığını hatırlattı. API geliştiricilere, ürünlerinde kullandıkları ayarları (Responses API, akıl yürütmeyi saklama, sıkıştırma) kullanmaları; model karşılaştırmalarında ise bu ayarları içeren değerlendirmelere güvenmeleri önerildi. OpenAI ayrıca, ARC'ye yıllar süren yaratıcı çalışmaları ve bu analizi tetikleyen araştırmaları için teşekkür etti.

Neden Önemli?

Bu bulgular, Türkiye'deki yapay zeka araştırmacıları ve geliştiricileri için önemli bir ders niteliğinde. Bir modelin gerçek performansını değerlendirirken, test düzeneğinin ve API ayarlarının etkisini göz ardı etmemek gerekiyor. OpenAI'nin keşfi, standart benchmarkların bile yanıltıcı olabileceğini ve modellerin gerçek dünya kullanım senaryolarına uygun şekilde test edilmesi gerektiğini gösteriyor. Türk yapay zeka ekosistemi için bu, kendi modellerini değerlendirirken daha dikkatli olmaları ve üretim ortamına en yakın ayarları kullanmaları gerektiği anlamına geliyor. Özellikle yerel dil modelleri geliştiren girişimler, benchmark sonuçlarını yorumlarken bu tür ayar farklılıklarını hesaba katmalı; aksi halde modellerinin gerçek potansiyelini gözden kaçırabilirler. Ayrıca, API sağlayıcılarının (örneğin Türkçe destek sunan platformlar) benzer ayarları kullanıcılarına sunması, modellerin daha verimli ve doğru çalışmasını sağlayabilir.

link Kaynak: OpenAI
tag OpenAI tag ARC-AGI-3 tag GPT-5.6 tag API ayarları tag akıl yürütme tag sıkıştırma

İlgili Terimler

6 terim