Reward Model (Ödül Modeli)

Ödül modeli, insan tercihlerini sayısal ödül sinyaline dönüştüren ve RLHF boru hattında politika modelini yönlendiren bir sinir ağıdır.

Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritması ile birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini "dondurulmuş" hâlde temsil eder. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. KL sapma penaltısı ve Constitutional AI gibi teknikler bu sorunu hafifletmek için kullanılır.

school Ödül Modeli Nasıl Eğitilir?

Ödül modeli eğitimi üç aşamadan oluşur. Veri toplama: Bir politika modeli (genellikle SFT modeli) aynı isteğe birden fazla yanıt üretir. İnsan değerlendiriciler bu yanıtları karşılaştırmalı olarak sıralar: "A yanıtı B yanıtından daha iyi." Bu tercih çiftleri eğitim verisi oluşturur. Model mimarisi: Ödül modeli genellikle politika modeliyle aynı mimariye (GPT, LLaMA vb.) sahip olup son katmanına tek bir değer kafası (value head) eklenerek bir skalar ödül değeri üretecek şekilde uyarlanır. Eğitim: Bradley-Terry kayıp fonksiyonu, tercih edilen yanıt için ödül puanının reddedilen yanıtın puanından daha yüksek olmasını teşvik eder: L = -log(σ(r_w - r_l)). Model bu kayıpla eğitilir. Eğitim sonunda ödül modeli dondurulur ve PPO optimizasyonunda kullanılır.

RLHF Boru Hattındaki Yeri

data_object Adım 1: Pretraining

Büyük veri kümeleriyle sonraki kelimeyi tahmin ederek temel dil yeteneği kazanılır. Model henüz talimat izlemeyi öğrenmemiştir.

tune Adım 2: SFT

Supervised Fine-Tuning: Yüksek kaliteli (istek, yanıt) çiftleriyle fine-tune edilir. Model talimat izlemeyi öğrenir.

star Adım 3: Reward Model

İnsan tercih çiftleriyle ödül modeli eğitilir. İnsan değerlerini ve tercihlerini sayısal sinyale dönüştürür.

loop Adım 4: PPO

Politika modeli PPO ile optimize edilir; ödül modeli her yanıta puan verir. KL penaltısı modelin SFT'den çok uzaklaşmasını önler.

security Ödül Hacklemesi ve Riskler

  • check_circle Ödül Hacklemesi: Model gerçek kalite yerine ödül modelinin puanlama zayıflıklarını sömürmeyi öğrenir. Uzun, aşırı kibar veya anlamsız tekrarlayan yanıtlar yüksek puan alabilir.
  • check_circle KL Sapma Penaltısı: PPO optimizasyonu sırasında SFT modelinden çok uzaklaşmayı cezalandıran KL ıraksaması penaltısı ödül hacklemesini frenler.
  • check_circle Ödül Model Genelleştirme: Ödül modeli yalnızca eğitim dağılımındaki tercih sinyalini genelleştirir. Dağılım dışı istemler için puanlar güvenilmez olabilir.
  • check_circle DPO Alternatifi: Direct Preference Optimization, ayrı ödül modeli eğitimini ve PPO döngüsünü ortadan kaldırarak doğrudan politika modelini tercih verisinden optimize eder.

quiz Sıkça Sorulan Sorular

  • check_circle Ödül modeli hangi veriyle eğitilir?: Karşılaştırmalı tercih verisiyle: Aynı isteğe verilen iki yanıt karşılaştırılır, değerlendirici hangisinin daha iyi olduğunu seçer. InstructGPT için OpenAI çalışanları ve konuyla uzman kişiler bu sıralama görevini gerçekleştirdi.
  • check_circle Ödül modeli ile politika modeli aynı boyutta mı olmalı?: Olmak zorunda değil, ancak genellikle yakın boyutlar tercih edilir. Çok küçük bir ödül modeli, büyük politika modelinin karmaşık çıktılarını değerlendirmede yetersiz kalabilir.
  • check_circle Açık kaynak ödül modeli var mı?: Evet. OpenAssistant ve Open-Instruct projeleri açık kaynak ödül modellerini yayımladı. Anthropic'in Constitutional AI'ı ayrı bir ödül modeli yerine AI geri bildirimi kullanır.