Neden Test Zamanı Hesaplama?
Geleneksel modeller cevabı neredeyse anında üretir; bu performansı belirleyen şey eğitim büyüklüğü ve parametredir. Ancak zor matematiksel problemleri veya karmaşık mantık görevlerini insan nasıl çözerse, çok daha fazla zaman harcayarak — model de aynı şekilde daha fazla hesaplama ile daha iyi yanıtlar üretebilir. Test zamanı hesaplama bu anlayışı formalize ederek modele "düşünme bütçesi" tanımlar.
OpenAI o1 Modeli
OpenAI o1, dahili bir düşünce zinciri (chain of thought) aracılığıyla soruyu yanıtlamadan önce bir "düşünme" süreci gerçekleştirir. Bu düşünme süreci kullanıcıya gösterilmez; ancak yanıt kalitesini önemli ölçüde artırır. Matematik, programlama ve bilimsel muhakeme gibi alanlarda o1, GPT-4'ü belirgin biçimde geçmektedir. o3 ve o3-mini, bu yaklaşımı daha ileri taşıyan sürümleridir.
Arama Tabanlı Yöntemler
Monte Carlo Tree Search (MCTS), satranç ve Go gibi oyunlarda çok etkili olduğunu kanıtlamış bir arama algoritması. LLM'lerde yanıt üretim sürecine MCTS uygulandığında model her adımda birden fazla olası devam keşfeder ve en umit verici dalı takip eder. DeepMind'in AlphaCode 2, büyük ölçekli kod arama ile programlama problemlerinde insan uzman düzeyine yaklaşmıştır.
Oylama ve Revizyon
Self-Consistency: aynı soru için birden fazla yanıt üretip en sık görüneni seçer. Bu yaklaşım, tek yanıta göre doğruluğu belirgin şekilde artırır. Self-refinement: modelin kendi yanıtını eleştirel bakış açısıyla gözden geçirmesi ve gerekirse düzeltmesi. Bu "otokritik" döngü, performansı özellikle yazılı mantık görevlerinde iyileştirmektedir. Her iki teknik ek hesaplama maliyeti gerektirse de büyük sonuç iyileştirme sağlar.
Test Zamanı Hesaplama Stratejileri
Zincir Düşünce
Modelin adım adım akıl yürütmesine izin vererek doğruluğu; daha fazla token üretimle artırır.
Self-Consistency
Aynı soruya çok sayıda yanıt üretip çoğunluk oylamasıyla en güvenilir cevabı seçer.
Best-of-N
N yanıt üretilir; ödül modeli veya doğrulayıcı en iyi yanıtı seçer; kalite N ile artar.
Arama Algoritmaları
Monte Carlo ağaç araması veya beam search ile düşünce uzayını genişleterek optimal çözüm bulur.
Sıkça Sorulan Sorular
- check_circle Test-time compute her görevde çalışır mı? Özellikle adım adım muhakeme gerektiren görevlerde (matematik, kod, mantık) etkilidir. Yaratıcı yazma veya basit sorular için ek faydası sınırlı olabilir.
- check_circle o1 neden daha pahalı? Daha uzun çıkarsama zinciri daha fazla token üretimi ve hesaplama gerektirir; maliyet genellikle standart modellerin 5-10x üzerindedir.
- check_circle Küçük model + uzun çıkarsama büyük modelle rekabet edebilir mi? Evet; araştırmalar belirli bütçe sınırında küçük modelin daha uzun çıkarsama ile büyük model + kısa çıkarsama ile rekabetçi olduğunu göstermektedir.
- check_circle Streaming ve test-time compute uyumlu mu? Evet; düşünce zinciri adımları akış halinde iletilebilir. o1 API bunu desteklemektedir.