RLVR pekiştirmeli öğrenme DeepSeek-R1 Qwen3 model hizalama LLM eğitimi

RLVR Nedir? Doğrulanabilir Ödülle Pekiştirmeli Öğrenme

Orta
person Yapay Zeka Uzmanı
list_altİçindekilerexpand_more
  1. 01RLHF’nin Sınırı Nerede?
  2. 02Doğrulanabilir Ödül Nedir?
  3. 03RLVR Döngüsü Nasıl İşliyor?
  4. 04GRPO ile İlişki
  5. 05Süreç Ödül Modeli ile Fark
  6. 06Hangi Modeller RLVR Kullanıyor?
  7. 07Neden Akıl Yürütmeyle Bu Kadar İlişkili?
  8. 08RLVR’nin Sınırları
  9. 09Constitutional AI ile Karşılaştırma
  10. 10Eğitim Maliyeti Açısından
  11. 11Araştırmanın Şu Anki Konumu
Editorial tech-magazine cover illustration about reinforcement learning with verifiable rewards, glowing mathematical equations and code symbols flowing through a neural network, abstract artificial-intelligence motifs with branching decision trees and verified checkmarks dissolving into data streams, sophisticated modern concept art, clean balanced composition, soft cinematic studio lighting, rich depth of field, premium color grading in deep navy blues with cyan and magenta accents, highly detailed, polished editorial 8k. No text, no words, no letters, no captions, no logos, no watermark, no UI.

RLVR — Doğrulanabilir ödülle pekiştirmeli öğrenme: matematiksel doğrulama akışlarını gösteren soyut sinir ağı görseli

Bir dil modeli matematik sorusunu çözdüğünde, cevabın doğru olup olmadığını bilgisayar anında hesaplayabilir. Kod yazdığında, test paketi saniyelerde sonucu verir. Bu iki durumda insan değerlendirmesine ihtiyaç yoktur. RLVR (Reinforcement Learning with Verifiable Rewards), ödül sinyalini insan geri bildiriminden değil, otomatik doğrulama mekanizmalarından üretiyor. Doğru cevap ya açıkça doğru, ya da açıkça yanlış.

DeepSeek-R1’in Ocak 2025’te yayınlanmasıyla RLVR adı araştırma camiasında belirginleşti. Ama kavramın temelleri daha eskiye dayanıyor. o3’ten Qwen3’e kadar günümüzün önde gelen akıl yürüten modellerinin ortak eğitim bileşeni bu yöntem.

RLHF’nin Sınırı Nerede?

RLHF, bir dil modelini insan tercihlerine göre hizalamanın uzun süre tek sistematik yolu oldu. Süreç üç adımdan oluşuyordu: denetimli ince ayar (SFT), insan tercih verisinden reward model eğitimi, ardından bu ödül modeliyle PPO döngüsü.

Bu yaklaşım ChatGPT ve Claude gibi modellerde etkili çalıştı; modeller insan beklentilerine yakın çıktılar üretmeye başladı. Ama iki temel sorun hep kaldı.

Ölçekleme problemi: Kaliteli insan tercih verisi pahalı ve yavaş toplanıyor. İki cevabı karşılaştıran değerlendiricilerin her soruda tutarlı yargı vermesi güç. İleri matematik, uzman tıbbi analiz veya karmaşık kod değerlendirme gibi bilgi yoğun alanlarda ise değerlendiricilerin neyin daha iyi olduğunu gerçekten kavrayıp kavrayamayacağı belirsiz kalıyor.

Reward hacking: Model gerçek kaliteyi artırmak yerine reward modelini kandırmayı öğreniyor. Uzun ama içerik açısından zayıf cevaplar üretiyor, çünkü reward modeli uzunluğu kaliteyle ilişkilendiriyor. Literatürde “reward hacking” veya “Goodhart Yasası” olarak bilinen bu sorun şöyle özetlenebilir: bir ölçüt hedef haline geldiğinde, artık iyi bir ölçüt olmaktan çıkıyor.

RLVR bu iki sorunu aynı hamlede çözmek için farklı bir zemine oturuyor.

Doğrulanabilir Ödül Nedir?

Doğrulanabilir görev, sonucun bağımsız ve otomatik olarak değerlendirilebildiği herhangi bir görevdir.

Matematik: Model bir denklem çözüyor. Cevap ya doğru ya yanlış. SymPy veya basit bir string karşılaştırma bu kararı verebilir. Annotator gerekmiyor.

Kod: Model bir fonksiyon yazıyor. Test paketi çalışıyor. Tüm testler geçiyorsa ödül 1, geçmiyorsa 0. Yargı subjektif değil.

Mantık bulmacaları: Grid bulmacaları, kısıt sağlama problemleri, Sudoku benzeri görevler. Çözüm doğrulama deterministik.

Resmi doğrulama: Lean veya Coq gibi ispat yardımcıları için yazılan ispatlar. Kabul edildi mi, reddedildi mi: ikili karar.

Bu görevlerde ödül sinyali hem daha güvenilir hem de ölçeklenebilir. İnsan değerlendirici ekibini büyütmek zorunda değilsiniz; test paketini büyütüyorsunuz.

Bu ölçek farkı pratikte belirleyici. MATH ve GSM8K gibi matematiksel benchmark setleri on binlerce sorudan oluşuyor; hepsinin ground truth cevabı var. Bir eğitim sırasında bu soruların tamamından ödül sinyali üretmek mümkün. Karşılaştırma için: tipik bir RLHF tercih veri seti birkaç yüz bin örnek içeriyor ama her satırı insan emeğiyle derleniyor. RLVR bu darboğazı ortadan kaldırıyor.

Abstract editorial illustration of verifiable reward signals in a training loop: mathematical proof symbols and code test results flowing as glowing cyan streams into a reinforcement learning cycle, neural network nodes lit up against a deep navy background with magenta highlights, conceptual data verification with branching logic trees, sophisticated modern concept art, soft cinematic studio lighting, polished editorial 8k. No text, no words, no letters, no captions, no logos, no watermark, no UI.

RLVR döngüsü — doğrulanabilir görev tipleri ve ödül sinyali akışı: kod testi ve matematiksel doğrulama mekanizmaları

RLVR Döngüsü Nasıl İşliyor?

RLVR pipeline’ı kavramsal olarak RLHF’ye benziyor ama kritik bir bileşeni çıkarıyor: ayrı reward modeli yok.

Adım 1: SFT tabanı. Eğitim, denetimli ince ayarla başlıyor. Model temel talimat takibini ve alan bilgisini kazanmış halde pekiştirmeli öğrenme aşamasına giriyor.

Adım 2: Görev örneklemesi. Eğitim veri kümesinden doğrulanabilir bir görev çekiliyor. Matematik sorusu, programlama problemi ya da mantık bulmacası.

Adım 3: Yanıt üretimi. Model bu göreve bir veya birden fazla yanıt üretiyor. GRPO gibi algoritmalar aynı soruya G adet farklı yanıt üretiyor; genellikle G=4 ile G=16 arasında bir değer seçiliyor.

Adım 4: Otomatik değerlendirme. Her yanıt doğrulama motoruna gönderiliyor. Motor sorunun türüne göre farklı çalışıyor: matematik sorusunda referans cevapla karşılaştırma, kod sorusunda test çalıştırma, mantık bulmacasında kısıt kontrolü.

Adım 5: Ödül sinyali. Değerlendirme sonucu bir ödül skoru üretiyor. En basit formda doğru yanıt +1, yanlış yanıt 0 veya -1. Daha gelişmiş versiyonlarda format uyumu, adım sayısı ve kısalık gibi ek kriterler ödüle katılabiliyor.

Adım 6: Politika güncellemesi. Ödül sinyali kullanılarak model ağırlıkları güncelleniyor. PPO veya GRPO bu adımı gerçekleştiriyor. Model doğru yanıt üretme olasılığını artıran parametrelere doğru kayıyor.

Bu döngü binlerce iterasyonda tekrarlandığında, model belirgin biçimde daha iyi akıl yürütme yetisi kazanıyor.

GRPO ile İlişki

RLVR bir hedef tanımı; hangi sinyali optimize edeceğinizi söylüyor. GRPO ise bu optimizasyonu gerçekleştiren algoritmadan biri.

GRPO (Group Relative Policy Optimization), aynı soruya G yanıt üretip bu yanıtlar arasındaki göreli ödül farkından öğrenme gradyanı hesaplıyor. PPO’nun critic ağını ortadan kaldırıyor; bu da bellek verimliliğini kayda değer ölçüde artırıyor.

RLVR ve GRPO kombinasyonu DeepSeek-R1’de pratikte kanıtlandı. Ekip, ayrı reward model olmadan yalnızca matematik ve kod doğrulama sinyalleriyle GPT-4 düzeyine yakın akıl yürütme performansı elde etti. Bellek verimliliği açısından da önemli bir fark var: PPO ile büyük modelleri eğitmek için bellekte hem policy modeli hem de aynı ölçekte bir critic tutmak gerekiyor. GRPO bu ikinci modeli devre dışı bıraktığı için aynı donanım çok daha büyük batch boyutlarına ya da daha uzun eğitim sürelerine ayrılabiliyor.

DPO ve RLHF ise tercih verisine dayalı farklı bir eksen. Aralarındaki temel fark, ödül sinyalinin kaynağı: RLHF ve DPO insan tercihinden başlıyor, RLVR deterministik doğrulamadan.

Süreç Ödül Modeli ile Fark

Süreç ödül modeli (PRM), ara adımları değerlendiriyor. Modelin nihai cevabı değil, çözüm sürecindeki her mantık adımı ayrı bir ödül alıyor. Bu yöntem özellikle çözüm sürecinin izlenebildiği yapılandırılmış problemlerde işe yarıyor.

RLVR ile PRM birbirini dışlamıyor; bir arada kullanılabiliyor. Model hem adım bazlı sinyal (PRM) hem de nihai doğrulama sinyali (RLVR) alabilir. OpenAI’nin o-serisi modellerinde bu hibrit yaklaşımın izleri görülüyor. Ancak PRM’nin kendi sınırlılıkları var: ara adımları değerlendiren bu modelin de yanlış kararlar verebileceği durumlar var; özellikle birden fazla geçerli çözüm yolunun bulunduğu problemlerde. Bu yüzden nihai doğrulama sinyali (RLVR) genellikle birincil sinyal olarak kalıyor, PRM ise yardımcı bir rehber görevini üstleniyor.

Hangi Modeller RLVR Kullanıyor?

DeepSeek-R1: Ocak 2025’te yayınlandı. RLVR ve GRPO kombinasyonunu büyük ölçekte uygulayan ilk açık ağırlıklı modellerden biri. Matematik ve kod doğrulamasını temel ödül sinyali olarak kullandı.

OpenAI o-serisi (o1, o3): Teknik detaylar kamuya açık değil, ama o-serisi modellerin doğrulanabilir görevlerde yoğun RL eğitiminden geçtiği araştırma yayınlarında belirtiliyor. o3’ün yüksek hesaplama bütçeleriyle RLVR tabanlı eğitimden yararlandığı rapor ediliyor.

Qwen3 (Alibaba): 2026’da yayınlanan Qwen3 ailesi, hem düşünce zinciri kabiliyeti hem de doğrulanabilir ödülle pekiştirmeli öğrenmeyi ön plana çıkardı.

Gemini 2 Think / Flash Thinking: Google DeepMind, thinking modellerinde benzer verifiable reward yaklaşımlarını kullandığını teknik raporlarda açıkladı.

Bu modellerin ortak noktası: akıl yürüten AI kategorisinde değerlendiriliyor ve hepsinde test zamanı hesaplaması (test-time compute) arttıkça performans iyileşiyor.

Neden Akıl Yürütmeyle Bu Kadar İlişkili?

RLVR ve chain-of-thought prompting arasındaki bağlantı şöyle kuruluyor: model düşünce zinciri üretmeyi öğrenirken, her adımın nihai doğru cevaba katkısı ödül sinyaliyle şekillendirilebiliyor.

Eğitim sırasında modele “önce düşün, sonra cevap ver” formatı dayatılıyor. Bu formatı kullanan modeller doğrulanabilir görevlerde daha yüksek ödül alıyor. Zaman içinde model kendi kendine daha uzun ve daha organize düşünce zincirleri geliştirmeyi öğreniyor. Ödül bu süreçte doğrudan düşünce kalitesini değil, nihai cevabın doğruluğunu ölçüyor. Ama doğru cevaba ulaşmak için daha iyi düşünmek gerektiğinden, model çözüm sürecini kendi kendine iyileştirmeye başlıyor. Bu, RLVR’nin akıl yürütme modellerinde istem dışı ama tutarlı bir çıktısı.

DeepSeek-R1’in teknik raporunda bu durum açıkça gözlemlendi: model eğitim sırasında insan müdahalesi olmadan “aha moment” benzeri düşünce örüntüleri geliştirdi, önceki adımlarını sorgulamaya ve revize etmeye başladı. Bu davranış başlangıçta planlanmamıştı; RLVR sinyalinin bir yan ürünü olarak ortaya çıktı.

RLVR’nin Sınırları

RLVR’nin kapsayamadığı alan var. Yaratıcı yazma, özetleme, genel sohbet gibi görevlerde “doğru cevap” yok. Bu alanlarda ödül sinyali üretmek için yine insan değerlendirmesine ya da bir proxy modeline dönmek gerekiyor.

Test paketleri de her zaman gerçek kaliteyi ölçmüyor. Bir model, testlerin geçmesi için özel durumları hardcode edebilir. RLHF’deki reward hacking’in kılık değiştirmiş hali bu.

RLVR aynı zamanda matematiksel akıl yürütme üzerine yoğunlaşıyor. Bu kapasitenin genel dil anlayışına ya da yaratıcı görevlere ne ölçüde aktarıldığı henüz net değil. Doğrulama için iyi yapılandırılmış, ground truth içeren veri setleri de gerekiyor ve her alan için böyle veri setleri mevcut değil.

Constitutional AI ile Karşılaştırma

Constitutional AI, Anthropic’in geliştirdiği ve modelin kendi ilkeler listesiyle çıktılarını değerlendirdiği bir yöntem. Burada ödül sinyali doğrulama motorundan değil, bir ilkeler kümesini yorumlayan başka bir modelden geliyor.

RLVR daha dar ama daha güvenilir bir sinyal kullanıyor. Constitutional AI daha geniş hizalama hedeflerini (değerler, güvenlik, yararlılık) kapsayabiliyor, ama sinyal kalitesi ilkeler yorumuna bağlı.

Bu iki yöntem rakip değil; tamamlayıcı. Güvenlik hizalaması için Constitutional AI tarzı yaklaşımlar, bilgi yoğun akıl yürütme için RLVR, genel tercih uyumu için RLHF. Bunlar birbirini dışlamıyor.

Eğitim Maliyeti Açısından

RLVR’nin pratik avantajlarından biri eğitim maliyetini düşürme potansiyeli. Ayrı bir reward model eğitmek büyük hesaplama bütçeleri gerektiriyor; bu modeli güncel tutmak için sürekli yeni annotasyon verisi lazım.

RLVR pipeline’ında bu yük yok. Test paketleri bir kez hazırlandıktan sonra defalarca kullanılabiliyor. Matematik benchmarkları için public veri setleri (MATH, GSM8K, AIME) zaten mevcut.

Bu özellik açık kaynak ekiplerinin güçlü modeller eğitmesinin önünü açtı. DeepSeek’in sınırlı bütçeyle GPT-4 düzeyine ulaşabilmesinin arkasında kısmen bu verimlilik yatıyor.

Araştırmanın Şu Anki Konumu

2026 itibarıyla RLVR araştırması birkaç açık soruyla uğraşıyor. Matematik ve kod dışında doğrulanabilir sinyal üretebileceğimiz başka alanlar var mı? Kimya tepkimeleri, biyolojik protein yapıları ve hukuki çıkarımlar bu açıdan araştırılıyor.

Doğrulanabilir ödül ile insan tercih sinyalini bir arada kullanan hibrit pipeline’lar da gündemde. Tek bir yöntemden daha geniş yetenekler sunuyor, ama karmaşıklığı da artırıyor.

Asıl açık soru genelleme: RLVR ile eğitilen modellerin doğrulanabilir olmayan görevlerdeki performansı ne yönde değişiyor? Çok adımlı problemlerde ara adımlara ödül vermek gerçekten işe yarıyor mu? Süreç ödül modelleri bu ikinci soruya yanıt arıyor. Transfer sorusu ise hâlâ net bir cevabı olmayan alan.

RLVR, annotasyon maliyeti olmadan güçlü akıl yürütme modellerinin eğitilmesini mümkün kıldı. Doğrulanabilir görevlerde hem güvenilir hem ölçeklenebilir bir sinyal veriyor. Kapsamı sınırlı; yaratıcı yazma veya genel sohbet bu çerçevenin dışında kalıyor. Ama matematik, kod ve ispat gibi alanlarda şu ana kadar denenen en tutarlı ödül sinyallerinden biri bu.

auto_stories İlgili Makaleler