Self-Consistency (Öz-Tutarlılık)

Aynı soruyu birden fazla bağımsız reasoning path ile çözen ve çoğunluk oylamasıyla en güvenilir yanıtı seçen LLM çıkarım stratejisi.

Self-Consistency (Öz-Tutarlılık), büyük dil modellerinin akıl yürütme görevlerindeki doğruluğunu artırmak için 2023 yılında Wang ve arkadaşları tarafından önerilen bir çözümleme stratejisidir. Yöntemin özü şudur: model, aynı soruya birbirinden bağımsız birden fazla çözüm yolu üretir; ardından en sık tekrar eden yanıt çoğunluk oylamasıyla (majority voting) nihai cevap olarak seçilir. Geleneksel greedy decoding stratejisinde model her adımda en yüksek olasılıklı tokeni seçer. Bu yaklaşım hızlı olsa da tek bir hatalı adım tüm çözüm zincirini bozabilir. Self-Consistency ise sıcaklık (temperature) parametresini yükselterek modelin stokastik örneklemesini etkinleştirir ve farklı düşünce yolları (reasoning paths) üretmesine olanak tanır. 10 ile 40 arasında örnek üretilip çoğunluk oylaması uygulandığında, matematiksel akıl yürütme ve ortak duygu (commonsense) görevlerinde greedy decoding'e kıyasla 5-18 puan iyileşme elde edildiği bildirilmiştir. Yöntemin temel sezgisi şudur: doğru çözüme birden fazla farklı yoldan ulaşılabilir, ama hatalı çözümler genellikle birbirinden farklı, dağınık yanıtlar üretir. Bu asimetri, çoğunluk oylamasını güçlü bir filtre hâline getirir. Chain-of-Thought (CoT) prompting ile birleştirildiğinde etkinliği daha da artar çünkü her reasoning path adım adım gerekçelendirilmiş olur. Pratik kısıtlar açısından değerlendirildiğinde, her sorgu için 10-40 kat daha fazla API çağrısı ve token tüketimi söz konusudur. Dolayısıyla Self-Consistency, latency'ye duyarlı üretim sistemlerinden çok yüksek doğruluk gerektiren toplu (batch) görevler için uygundur. Günümüzde bu ilke, OpenAI o1/o3 ve DeepSeek-R1 gibi thinking modellerinin test-time compute stratejilerinde yerleşik hâle gelmiştir.

Nasıl Çalışır?

Self-Consistency üç adımda işler. Birinci adımda soru, Chain-of-Thought formatıyla (adım adım gerekçelendirme) modele sunulur. İkinci adımda yüksek temperature (örn. 0.7-1.0) kullanılarak model, aynı soruya 10-40 arasında farklı düşünce zinciri üretir; her çalıştırma birbirinden bağımsız ve stokastik bir yol izler. Üçüncü adımda her path'in ulaştığı nihai yanıt toplanır ve en sık görülen cevap çoğunluk oylamasıyla seçilir. Matematiksel görevlerde sayısal eşitlik, serbest yanıtlarda ise anlamsal kümeleme kullanılır. Yöntemin işe yaramasının sezgisel açıklaması şudur: hatalı akıl yürütmeler genellikle birbirinden farklı çıkmaza gider, doğru akıl yürütmeler ise aynı doğru yanıtta buluşur. Bu asimetri, çoğunluk oylamasını güvenilir bir filtre yapar.

Chain-of-Thought ile İlişkisi

Self-Consistency, Chain-of-Thought prompting'in doğrudan bir uzantısıdır. CoT tek bir çözüm yolu üretirken Self-Consistency bunu paralel koşmalar hâline getirir. Wang et al. 2023, standart CoT'un en iyi örneklerle bile yanlış adım atarak yanıltıcı sonuçlara varabildiğini gözlemledi; birden fazla path üreterek bu kırılgan davranış azaltılır. Önemli bir ayrım: Self-Consistency yalnızca nihai yanıtı oylar, ara adım gerekçelerini değil. Bu, her iki path de aynı doğru sonuca farklı yoldan ulaşabildiğinde ödüllendirici; ancak yanıtlar sürekli farklıysa modelin güven düzeyi düşük demektir ve bu bilgi de değerli bir kalibrasyon sinyalidir.

Maliyet ve Sınırlamalar

Self-Consistency'nin en belirgin dezavantajı maliyet çarpanıdır. 20 path için yapılan çağrı sayısı ve token tüketimi 20 kat artar; bu da gerçek zamanlı uygulamalarda gecikme ve maliyeti ciddi biçimde yükseltir. Path sayısı artarken kazanım marjinal azalır: 5 path'ten 10'a geçiş kayda değer bir artış sağlarken 30'dan 40'a geçişte iyileşme önemsizleşir. Kapalı uçlu sorularda yöntem sınırlı fayda sunar; iki seçenek arasında oylama bilgi eklemiyor. Son olarak, tüm path'ler aynı sistematik hatayı üretiyorsa çoğunluk oylaması yanlış yanıtı güçlendirir — yöntem belirli hataları azaltmaz, çoğaltır.