tag Chain of Thought

Test-Time Compute (Test Anı Hesaplama)

Bu sayfada Chain of Thought (Test-Time Compute (Test Anı Hesaplama)) etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.

Test zamanı hesaplama (test-time compute veya inference-time compute), bir yapay zeka modelinin çıkarsama (inference) aşamasında daha fazla hesaplama kaynağı kullanarak doğruluğunu artırma yaklaşımıdır. Eğitim sırasında sabitlenen parametreler sonrasında modele daha fazla "düşünme" süresi veya daha fazla hesaplama bütçesi ayrılarak daha iyi sonuçlar üretmesi hedeflenir. Bu kavram, OpenAI'nin o1 modeliyle geniş kitlelerce bilinir hale gelmiştir. o1, kullanıcının göremediği dahili bir "düşünce zinciri" (chain of thought) aracılığıyla zor problemler üzerinde daha uzun hesaplama yapar. Matematiksel kanıt, karmaşık kod yazımı veya çok adımlı mantık görevi gibi senaryolarda o1'in ekstra çıkarsama süresi doğruluğu belirgin şekilde artırır. Test zamanı hesaplamanın ana yöntemleri şunlardır: zincir düşünce (chain-of-thought) gerçekleştirme — modelin yanıt vermeden önce ara akıl yürütme adımlarını yazmasını sağlamak; arama (search) — Monte Carlo Tree Search veya beam search ile çok sayıda olası yanıt yolunu keşfetmek; oylama (voting / majority voting) — birden fazla yanıt üretip çoğunluk oylamasıyla en uygun şekilde seçmek; revizyon — modelin kendi yanıtını daha sonra gözden geçirip geri bildirim vermesi. Test zamanı hesaplama, "ölçekleme yasalarının" (scaling laws) yeni bir boyutudur. Geleneksel ölçekleme yasaları eğitim veri büyüklüğü ve model parametresi sayısıyla ilgilenirken test zamanı ölçekleme çıkarsama bütçesiyle ilgilenmektedir. Bu yaklaşım, daha ucuz ve küçük modellerin daha güçlü modellere kıyasla uzun çıkarsama bütçesiyle rekabetçi sonuçlar üretebileceğini göstermiştir. Pratikte test zamanı hesaplama, adım adım muhakeme gerektiren görevlerde en belirgin faydayı sunar. Matematik olimpiyat soruları, çok adımlı programlama problemleri ve bilimsel çıkarsama görevlerinde test zamanı bütçesi artırıldıkça doğruluk eğrisi belirgin biçimde yükselir. Buna karşın, tek adımlı bilgi soruları veya yaratıcı yazarlık gibi görevlerde ek hesaplama her zaman orantılı bir iyileşme getirmez. Bu nedenle görev tipine ve maliyet kısıtına göre compute-optimal çıkarsama bütçesi belirlenmesi, production sistemlerinde kritik bir tasarım kararı haline gelmiştir. DeepMind'in AlphaCode 2 ve Google'ın Gemini modellerinde uygulanan verifier-guided search yaklaşımı, bir doğrulayıcı modelin aday yanıtları puanlamasına ve en yüksek puanlı yanıtın seçilmesine dayanır. Bu mimari, yalnızca tek yanıt üreten standart çıkarsama stratejisine kıyasla özellikle kodlama ve matematiksel ispat görevlerinde kayda değer doğruluk artışı sağlar.

timer

Test-Time Compute (Test Anı Hesaplama)

Test zamanı hesaplama (test-time compute veya inference-time compute), bir yapay zeka modelinin çıkarsama (inference) aşamasında daha fazla hesaplama kaynağı kullanarak doğruluğunu artırma yaklaşımıdır. Eğitim sırasında sabitlenen parametreler sonrasında modele daha fazla "düşünme" süresi veya daha fazla hesaplama bütçesi ayrılarak daha iyi sonuçlar üretmesi hedeflenir. Bu kavram, OpenAI'nin o1 modeliyle geniş kitlelerce bilinir hale gelmiştir. o1, kullanıcının göremediği dahili bir "düşünce zinciri" (chain of thought) aracılığıyla zor problemler üzerinde daha uzun hesaplama yapar. Matematiksel kanıt, karmaşık kod yazımı veya çok adımlı mantık görevi gibi senaryolarda o1'in ekstra çıkarsama süresi doğruluğu belirgin şekilde artırır. Test zamanı hesaplamanın ana yöntemleri şunlardır: zincir düşünce (chain-of-thought) gerçekleştirme — modelin yanıt vermeden önce ara akıl yürütme adımlarını yazmasını sağlamak; arama (search) — Monte Carlo Tree Search veya beam search ile çok sayıda olası yanıt yolunu keşfetmek; oylama (voting / majority voting) — birden fazla yanıt üretip çoğunluk oylamasıyla en uygun şekilde seçmek; revizyon — modelin kendi yanıtını daha sonra gözden geçirip geri bildirim vermesi. Test zamanı hesaplama, "ölçekleme yasalarının" (scaling laws) yeni bir boyutudur. Geleneksel ölçekleme yasaları eğitim veri büyüklüğü ve model parametresi sayısıyla ilgilenirken test zamanı ölçekleme çıkarsama bütçesiyle ilgilenmektedir. Bu yaklaşım, daha ucuz ve küçük modellerin daha güçlü modellere kıyasla uzun çıkarsama bütçesiyle rekabetçi sonuçlar üretebileceğini göstermiştir. Pratikte test zamanı hesaplama, adım adım muhakeme gerektiren görevlerde en belirgin faydayı sunar. Matematik olimpiyat soruları, çok adımlı programlama problemleri ve bilimsel çıkarsama görevlerinde test zamanı bütçesi artırıldıkça doğruluk eğrisi belirgin biçimde yükselir. Buna karşın, tek adımlı bilgi soruları veya yaratıcı yazarlık gibi görevlerde ek hesaplama her zaman orantılı bir iyileşme getirmez. Bu nedenle görev tipine ve maliyet kısıtına göre compute-optimal çıkarsama bütçesi belirlenmesi, production sistemlerinde kritik bir tasarım kararı haline gelmiştir. DeepMind'in AlphaCode 2 ve Google'ın Gemini modellerinde uygulanan verifier-guided search yaklaşımı, bir doğrulayıcı modelin aday yanıtları puanlamasına ve en yüksek puanlı yanıtın seçilmesine dayanır. Bu mimari, yalnızca tek yanıt üreten standart çıkarsama stratejisine kıyasla özellikle kodlama ve matematiksel ispat görevlerinde kayda değer doğruluk artışı sağlar.

arrow_forward
sync_alt

ReAct (Akıl Yürütme + Eylem)

ReAct (Reasoning + Acting), büyük dil modellerinin (LLM) akıl yürütme izlerini (reasoning traces) ve eylemleri (actions) birbirine kenetleyerek ürettiği bir prompting çerçevesidir. Shunyu Yao ve arkadaşları tarafından 2022 yılında yayımlanan "ReAct: Synergizing Reasoning and Acting in Language Models" makalesiyle tanıtılmıştır. Geleneksel zincir-düşünce (Chain-of-Thought) prompting'i yalnızca dahili akıl yürütmeye dayanırken, ReAct modelin aynı zamanda harici araçlarla (web arama, hesap makinesi, veritabanı sorgusu) etkileşime girmesine olanak tanır. Her adımda model önce bir düşünce üretir (Thought), ardından bir eylem gerçekleştirir (Action), sonra bu eylemin sonucunu gözlemler (Observation) ve döngü tekrarlanır. ReAct döngüsü şu şekilde işler: 1) Model mevcut bağlamı değerlendirerek sıradaki adım için bir plan düşüncesi (Thought) üretir. 2) Bir araç çağrısı veya başka bir eylem (Action) tanımlar. 3) Araçtan dönen sonucu gözlemler (Observation). 4) Gözlemi bağlama ekleyerek yeni bir Thought üretir. Bu döngü görev tamamlanana kadar devam eder. ReAct, AI ajan çerçevelerinin (LangChain, LlamaIndex, OpenAI Agents, Google Vertex AI Agents) temel akıl yürütme stratejisi olarak yaygınlaşmıştır. Özellikle açık uçlu soru cevaplama, olgusal doğrulama (fact-checking) ve çok adımlı problem çözmede saf CoT'a kıyasla belirgin doğruluk artışı sağlar. Modelin hem düşüncesini hem de eylemini izlenebilir kılması, hata ayıklamayı ve güvenilirliği artırır. Pratik uygulamada ReAct bazı zorluklarla karşılaşılır: uzun döngülerde bağlam penceresinin taşması, tekrarlanan araç çağrılarıyla oluşan eylem döngüleri (action loops) ve hatalı araç parametrelerinden kaynaklanan kırılmalar bunların başında gelir. Bu sorunlara yanıt olarak Reflexion, Plan-and-Execute ve Tree of Thoughts gibi çerçeveler geliştirilmiştir. OpenAI'nin function calling ve Anthropic'in tool use API'leri ReAct mantığını yapılandırılmış JSON araç çağrısına dönüştürerek kararlılığı önemli ölçüde artırmaktadır. 2024-2026 itibarıyla çoğu üretim ortamı ajan sistemi, ReAct'in temel Thought-Action-Observation soyutlamasını alt katman olarak korurken üzerine hafıza, paralel görev yürütme ve hata kurtarma mekanizmaları eklemektedir.

arrow_forward
code_blocks

Self-Consistency (Öz-Tutarlılık)

Self-Consistency (Öz-Tutarlılık), büyük dil modellerinin akıl yürütme görevlerindeki doğruluğunu artırmak için Xuezhi Wang ve arkadaşlarının 2022'de arXiv'de yayımladığı ve ICLR 2023'te sunduğu bir çözümleme (decoding) stratejisidir. Yöntemin özü şudur: model, aynı soruya birbirinden bağımsız birden fazla çözüm yolu üretir; ardından en sık tekrar eden nihai yanıt çoğunluk oylamasıyla (majority voting) seçilir. Geleneksel greedy decoding stratejisinde model her adımda en yüksek olasılıklı tokeni seçer. Bu yaklaşım hızlı olsa da tek bir hatalı adım tüm çözüm zincirini bozabilir. Self-Consistency ise sıcaklık (temperature) parametresini yükselterek modelin stokastik örneklemesini etkinleştirir ve farklı düşünce yolları (reasoning paths) üretmesine olanak tanır. 10 ile 40 arasında örnek üretilip çoğunluk oylaması uygulandığında, aritmetik akıl yürütme ve sağduyu (commonsense) görevlerinde greedy Chain-of-Thought'a kıyasla 4 ile 18 puan arasında iyileşme bildirilmiştir; GSM8K'da PaLM-540B ile bu fark yaklaşık 18 puandır. Yöntemin temel sezgisi şudur: doğru çözüme birden fazla farklı yoldan ulaşılabilir, hatalı çözümler ise genellikle birbirinden farklı, dağınık yanıtlara savrulur. Bu asimetri, çoğunluk oylamasını güçlü bir filtre hâline getirir. Chain-of-Thought (CoT) prompting ile birleştirildiğinde etkinliği daha da artar, çünkü her reasoning path adım adım gerekçelendirilmiş olur ve yalnızca nihai yanıt oylanır; ara adımların birbirinden farklı olması sorun oluşturmaz. Uygulama tarafında Self-Consistency ek bir model, doğrulayıcı (verifier) ya da yeniden eğitim gerektirmez; yalnızca örnekleme parametreleri ve basit bir sayım mantığı yeterlidir. Bu yüzden hem kapalı API'lerle hem de açık ağırlıklı modellerle kullanılabilir. Yanıtların birbirine ne kadar yakın olduğu ayrıca bir güven (kalibrasyon) sinyali olarak okunabilir: oylar dağınıksa modelin o soruda kararsız olduğu anlaşılır. Pratik kısıtlar açısından değerlendirildiğinde, her sorgu için 10 ile 40 kat daha fazla API çağrısı ve token tüketimi söz konusudur. Dolayısıyla Self-Consistency, gecikmeye duyarlı üretim sistemlerinden çok yüksek doğruluk gerektiren toplu (batch) görevler, değerlendirme setleri ve veri etiketleme akışları için uygundur. Günümüzde aynı ilke, OpenAI o1/o3 ve DeepSeek-R1 gibi düşünen modellerin test-time compute stratejilerinde ve Best-of-N örnekleme yaklaşımlarında yerleşik hâle gelmiştir.

arrow_forward
engineering

Prompt Engineering (Prompt Mühendisliği)

Prompt mühendisliği (Prompt Engineering), büyük dil modellerinden (LLM) istenen çıktıyı elde etmek için girdi talimatlarını sistematik biçimde tasarlama ve optimize etme disiplinidir. Modelin parametrelerini değiştirmeden, yalnızca metin girdisini biçimlendirerek model davranışını yönlendirmek bu disiplinin özünü oluşturur. Etkili bir prompt; görevin net tanımını, bağlamı, format yönergelerini ve gerekiyorsa örnek girdi-çıktı çiftlerini içerir. "Bana bir e-posta yaz" ile "Müşteriye sipariş gecikmesini özür dileyerek açıklayan, profesyonel, 3 paragraftan oluşan bir e-posta yaz" arasındaki fark, bu disiplinin temel mantığını yansıtır. Temel teknikler şunlardır: Zero-shot prompting modelden önceki örnek göstermeksizin görev yapmasını ister. Few-shot prompting 2-5 örnek göstererek modeli yönlendirir ve çıktı formatını öğretir. Chain-of-Thought (CoT), "adım adım düşün" talimatıyla modelin akıl yürütme zincirini görünür kılar; karmaşık matematik ve mantık problemlerinde başarıyı önemli ölçüde artırır. Tree-of-Thoughts ise birden fazla akıl yürütme yolunu paralel değerlendirir. Sistem promptu, modelin rol ve davranış çerçevesini belirleyen kalıcı bir talimat katmanıdır; kullanıcı girdisinden önce işlenir. Güvenlik açısından kritik olan prompt injection saldırıları, kötü niyetli kullanıcı girdilerinin sistem promptunu geçersiz kılmaya çalıştığı bir tehdit vektörüdür. Koruma için girdi sanitizasyonu ve güvenilir içerik etiketleme uygulanır. Araçlar ekosistemi hızla genişlemektedir: LangChain ve LlamaIndex RAG pipeline'larında prompt yönetimi sunarken, PromptLayer prompt sürümleme imkânı tanır. DSPy (Stanford) ise promptları insanlar yerine algoritmaların optimize ettiği otomatik prompt optimizasyonu yaklaşımıdır. Türkiye'de prompt mühendisliği becerisi; müşteri hizmetleri otomasyonu, hukuki metin analizi ve yazılım geliştirme iş akışlarında giderek daha fazla aranmaktadır. Türkçe promptlarda dil yapısına özgü dikkat noktaları (SOV söz dizimi, eylem çekimi, soru ekleri) model çıktı kalitesini doğrudan etkiler; teknik terimlerin İngilizce karşılığını parantez içinde eklemek belirsizliği azaltır. GPT-4o ve Claude gibi güçlü modellerde Türkçe few-shot örnekler çıktı kalitesini belirgin biçimde artırır.

arrow_forward