school Ödül Modeli Nasıl Eğitilir?
Ödül modeli eğitimi üç aşamadan oluşur. Veri toplama: Bir politika modeli (genellikle SFT modeli) aynı isteğe birden fazla yanıt üretir. İnsan değerlendiriciler bu yanıtları karşılaştırmalı olarak sıralar: "A yanıtı B yanıtından daha iyi." Bu tercih çiftleri eğitim verisi oluşturur. Model mimarisi: Ödül modeli genellikle politika modeliyle aynı mimariye (GPT, LLaMA vb.) sahip olup son katmanına tek bir değer kafası (value head) eklenerek bir skaler ödül değeri üretecek şekilde uyarlanır. Eğitim: Bradley-Terry kayıp fonksiyonu, tercih edilen yanıt için ödül puanının reddedilen yanıtın puanından daha yüksek olmasını teşvik eder: L = -log(σ(r_w - r_l)). Eğitim sonunda ödül modeli dondurulur ve PPO optimizasyonunda sinyal kaynağı olarak kullanılır.
RLHF Boru Hattındaki Yeri
data_object Adım 1: Pretraining
Büyük veri kümeleriyle sonraki kelimeyi tahmin ederek temel dil yeteneği kazanılır. Model henüz talimat izlemeyi öğrenmemiştir.
tune Adım 2: SFT
Supervised Fine-Tuning: Yüksek kaliteli (istek, yanıt) çiftleriyle fine-tune edilir. Model talimat izlemeyi öğrenir.
star Adım 3: Reward Model
İnsan tercih çiftleriyle ödül modeli eğitilir. İnsan değerlerini ve tercihlerini sayısal sinyale dönüştürür.
loop Adım 4: PPO
Politika modeli PPO ile optimize edilir; ödül modeli her yanıta puan verir. KL penaltısı modelin SFT'den çok uzaklaşmasını önler.
security Ödül Hacklemesi ve Riskler
- check_circle Ödül Hacklemesi: Model gerçek kalite yerine ödül modelinin puanlama zayıflıklarını sömürmeyi öğrenir. Uzun, aşırı kibar veya anlamsız tekrarlayan yanıtlar yüksek puan alabilir.
- check_circle KL Sapma Penaltısı: PPO optimizasyonu sırasında SFT modelinden çok uzaklaşmayı cezalandıran KL ıraksaması penaltısı ödül hacklemesini frenler.
- check_circle Ödül Model Genelleştirme: Ödül modeli yalnızca eğitim dağılımındaki tercih sinyalini genelleştirir. Dağılım dışı istemler için puanlar güvenilmez olabilir.
- check_circle DPO Alternatifi: Direct Preference Optimization, ayrı ödül modeli eğitimini ve PPO döngüsünü ortadan kaldırarak doğrudan politika modelini tercih verisinden optimize eder.
compare Ödül Modeli Alternatifleri
- check_circle RLHF + PPO: Klasik yöntem. Açık ödül modeli eğitimi + PPO optimizasyonu. Yüksek kalite ama karmaşık altyapı, yüksek hesaplama maliyeti. GPT-4, Claude 2 bu yolla eğitildi.
- check_circle DPO (Direct Preference Optimization): Ödül modelsiz. Tercih verisi doğrudan politika modelini optimize eder. Daha basit, düşük maliyet. Llama-3, Mistral-Instruct gibi açık modeller bu yöntemi benimsedi.
- check_circle Constitutional AI (CAI): Anthropic'in yöntemi. İnsan tercih verisi yerine AI geri bildirimi (AI-yazılmış kriter listesi) kullanılır. RLAIF olarak da bilinir. Ölçeklenebilir insan denetimi azaltır.
- check_circle GRPO / Online DPO: Çevrimiçi tercih optimizasyonu; model kendi ürettiği çıktıları değerlendirerek öğrenir. DeepSeek-R1 gibi akıl yürütme modellerinde tercih edilir.
quiz Sık Sorulan Sorular
- check_circle Ödül modeli hangi veriyle eğitilir?: Karşılaştırmalı tercih verisiyle: Aynı isteğe verilen iki yanıt karşılaştırılır, değerlendirici hangisinin daha iyi olduğunu seçer. InstructGPT için OpenAI çalışanları ve uzmanlar bu sıralama görevini gerçekleştirdi.
- check_circle Ödül modeli ile politika modeli aynı boyutta mı olmalı?: Olmak zorunda değil, ancak genellikle yakın boyutlar tercih edilir. Çok küçük bir ödül modeli, büyük politika modelinin karmaşık çıktılarını değerlendirmede yetersiz kalabilir.
- check_circle DPO mu, RLHF mi kullanmalıyım?: Kaynak kısıtlıysa ve tercih veri kümesi mevcut ise DPO tercih edin. Yüksek kalite ve ayrıntılı kontrol gerekiyorsa RLHF daha güçlüdür; ama daha karmaşık altyapı gerektirir.
- check_circle Açık kaynak ödül modeli var mı?: Evet. OpenAssistant ve Open-Instruct projeleri açık kaynak ödül modelleri yayımladı. Hugging Face'in TRL kütüphanesi ödül modeli eğitimini kolaylaştırır.
- check_circle Ödül hacklemesini nasıl önlerim?: KL penaltısı ekleyin, ödül modeli boyutunu politika modeliyle dengeleyin, çeşitli ve kapsamlı tercih verisi kullanın, düzenli insan değerlendirmesiyle model kalitesini izleyin.