Reward Model (Ödül Modeli)

Ödül modeli, insan tercihlerini sayısal ödül sinyaline dönüştüren ve RLHF boru hattında politika modelini yönlendiren bir sinir ağıdır.

Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur ve GPT-4, Claude ve Gemini gibi üretim modellerinin temelinde yer alır. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. L = -log(σ(r_w - r_l)) formülü bu ilişkiyi matematiksel olarak ifade eder. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritmasıyla birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini 'dondurulmuş' hâlde temsil eder. KL sapma penaltısı, modelin SFT temel çizgisinden aşırı uzaklaşmasını frenleyerek ödül hacklemesini önler. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. Çok uzun yanıtlar, aşırı kibar ifadeler veya anlamsız tekrarlar yüksek puan alabilir. Constitutional AI ve Direct Preference Optimization (DPO), ayrı bir ödül modeli gerektirmeden tercih hizalaması yaparak bu bağımlılığı azaltan alternatif yaklaşımlardır. DPO özellikle daha düşük hesaplama maliyetiyle benzer hizalama kalitesine ulaşabildiği için 2024-2025'te yaygınlaşmıştır. Uygulamada ödül modelinin kalitesi, nihai modelin davranışını doğrudan etkiler: yetersiz ya da önyargılı tercih verisiyle eğitilen bir ödül modeli, politika modelini istenmeyen yönlere yönlendirebilir. Bu nedenle veri çeşitliliği, değerlendirici eğitimi ve ödül modelinin düzenli yeniden eğitimi üretim ölçeğinde kritik operasyonel gereksinimlerdir.

school Ödül Modeli Nasıl Eğitilir?

Ödül modeli eğitimi üç aşamadan oluşur. Veri toplama: Bir politika modeli (genellikle SFT modeli) aynı isteğe birden fazla yanıt üretir. İnsan değerlendiriciler bu yanıtları karşılaştırmalı olarak sıralar: "A yanıtı B yanıtından daha iyi." Bu tercih çiftleri eğitim verisi oluşturur. Model mimarisi: Ödül modeli genellikle politika modeliyle aynı mimariye (GPT, LLaMA vb.) sahip olup son katmanına tek bir değer kafası (value head) eklenerek bir skaler ödül değeri üretecek şekilde uyarlanır. Eğitim: Bradley-Terry kayıp fonksiyonu, tercih edilen yanıt için ödül puanının reddedilen yanıtın puanından daha yüksek olmasını teşvik eder: L = -log(σ(r_w - r_l)). Eğitim sonunda ödül modeli dondurulur ve PPO optimizasyonunda sinyal kaynağı olarak kullanılır.

RLHF Boru Hattındaki Yeri

data_object Adım 1: Pretraining

Büyük veri kümeleriyle sonraki kelimeyi tahmin ederek temel dil yeteneği kazanılır. Model henüz talimat izlemeyi öğrenmemiştir.

tune Adım 2: SFT

Supervised Fine-Tuning: Yüksek kaliteli (istek, yanıt) çiftleriyle fine-tune edilir. Model talimat izlemeyi öğrenir.

star Adım 3: Reward Model

İnsan tercih çiftleriyle ödül modeli eğitilir. İnsan değerlerini ve tercihlerini sayısal sinyale dönüştürür.

loop Adım 4: PPO

Politika modeli PPO ile optimize edilir; ödül modeli her yanıta puan verir. KL penaltısı modelin SFT'den çok uzaklaşmasını önler.

security Ödül Hacklemesi ve Riskler

  • check_circle Ödül Hacklemesi: Model gerçek kalite yerine ödül modelinin puanlama zayıflıklarını sömürmeyi öğrenir. Uzun, aşırı kibar veya anlamsız tekrarlayan yanıtlar yüksek puan alabilir.
  • check_circle KL Sapma Penaltısı: PPO optimizasyonu sırasında SFT modelinden çok uzaklaşmayı cezalandıran KL ıraksaması penaltısı ödül hacklemesini frenler.
  • check_circle Ödül Model Genelleştirme: Ödül modeli yalnızca eğitim dağılımındaki tercih sinyalini genelleştirir. Dağılım dışı istemler için puanlar güvenilmez olabilir.
  • check_circle DPO Alternatifi: Direct Preference Optimization, ayrı ödül modeli eğitimini ve PPO döngüsünü ortadan kaldırarak doğrudan politika modelini tercih verisinden optimize eder.

compare Ödül Modeli Alternatifleri

  • check_circle RLHF + PPO: Klasik yöntem. Açık ödül modeli eğitimi + PPO optimizasyonu. Yüksek kalite ama karmaşık altyapı, yüksek hesaplama maliyeti. GPT-4, Claude 2 bu yolla eğitildi.
  • check_circle DPO (Direct Preference Optimization): Ödül modelsiz. Tercih verisi doğrudan politika modelini optimize eder. Daha basit, düşük maliyet. Llama-3, Mistral-Instruct gibi açık modeller bu yöntemi benimsedi.
  • check_circle Constitutional AI (CAI): Anthropic'in yöntemi. İnsan tercih verisi yerine AI geri bildirimi (AI-yazılmış kriter listesi) kullanılır. RLAIF olarak da bilinir. Ölçeklenebilir insan denetimi azaltır.
  • check_circle GRPO / Online DPO: Çevrimiçi tercih optimizasyonu; model kendi ürettiği çıktıları değerlendirerek öğrenir. DeepSeek-R1 gibi akıl yürütme modellerinde tercih edilir.

quiz Sık Sorulan Sorular

  • check_circle Ödül modeli hangi veriyle eğitilir?: Karşılaştırmalı tercih verisiyle: Aynı isteğe verilen iki yanıt karşılaştırılır, değerlendirici hangisinin daha iyi olduğunu seçer. InstructGPT için OpenAI çalışanları ve uzmanlar bu sıralama görevini gerçekleştirdi.
  • check_circle Ödül modeli ile politika modeli aynı boyutta mı olmalı?: Olmak zorunda değil, ancak genellikle yakın boyutlar tercih edilir. Çok küçük bir ödül modeli, büyük politika modelinin karmaşık çıktılarını değerlendirmede yetersiz kalabilir.
  • check_circle DPO mu, RLHF mi kullanmalıyım?: Kaynak kısıtlıysa ve tercih veri kümesi mevcut ise DPO tercih edin. Yüksek kalite ve ayrıntılı kontrol gerekiyorsa RLHF daha güçlüdür; ama daha karmaşık altyapı gerektirir.
  • check_circle Açık kaynak ödül modeli var mı?: Evet. OpenAssistant ve Open-Instruct projeleri açık kaynak ödül modelleri yayımladı. Hugging Face'in TRL kütüphanesi ödül modeli eğitimini kolaylaştırır.
  • check_circle Ödül hacklemesini nasıl önlerim?: KL penaltısı ekleyin, ödül modeli boyutunu politika modeliyle dengeleyin, çeşitli ve kapsamlı tercih verisi kullanın, düzenli insan değerlendirmesiyle model kalitesini izleyin.