school Ödül Modeli Nasıl Eğitilir?
Ödül modeli eğitimi üç aşamadan oluşur. Veri toplama: Bir politika modeli (genellikle SFT modeli) aynı isteğe birden fazla yanıt üretir. İnsan değerlendiriciler bu yanıtları karşılaştırmalı olarak sıralar: "A yanıtı B yanıtından daha iyi." Bu tercih çiftleri eğitim verisi oluşturur. Model mimarisi: Ödül modeli genellikle politika modeliyle aynı mimariye (GPT, LLaMA vb.) sahip olup son katmanına tek bir değer kafası (value head) eklenerek bir skalar ödül değeri üretecek şekilde uyarlanır. Eğitim: Bradley-Terry kayıp fonksiyonu, tercih edilen yanıt için ödül puanının reddedilen yanıtın puanından daha yüksek olmasını teşvik eder: L = -log(σ(r_w - r_l)). Model bu kayıpla eğitilir. Eğitim sonunda ödül modeli dondurulur ve PPO optimizasyonunda kullanılır.
RLHF Boru Hattındaki Yeri
data_object Adım 1: Pretraining
Büyük veri kümeleriyle sonraki kelimeyi tahmin ederek temel dil yeteneği kazanılır. Model henüz talimat izlemeyi öğrenmemiştir.
tune Adım 2: SFT
Supervised Fine-Tuning: Yüksek kaliteli (istek, yanıt) çiftleriyle fine-tune edilir. Model talimat izlemeyi öğrenir.
star Adım 3: Reward Model
İnsan tercih çiftleriyle ödül modeli eğitilir. İnsan değerlerini ve tercihlerini sayısal sinyale dönüştürür.
loop Adım 4: PPO
Politika modeli PPO ile optimize edilir; ödül modeli her yanıta puan verir. KL penaltısı modelin SFT'den çok uzaklaşmasını önler.
security Ödül Hacklemesi ve Riskler
- check_circle Ödül Hacklemesi: Model gerçek kalite yerine ödül modelinin puanlama zayıflıklarını sömürmeyi öğrenir. Uzun, aşırı kibar veya anlamsız tekrarlayan yanıtlar yüksek puan alabilir.
- check_circle KL Sapma Penaltısı: PPO optimizasyonu sırasında SFT modelinden çok uzaklaşmayı cezalandıran KL ıraksaması penaltısı ödül hacklemesini frenler.
- check_circle Ödül Model Genelleştirme: Ödül modeli yalnızca eğitim dağılımındaki tercih sinyalini genelleştirir. Dağılım dışı istemler için puanlar güvenilmez olabilir.
- check_circle DPO Alternatifi: Direct Preference Optimization, ayrı ödül modeli eğitimini ve PPO döngüsünü ortadan kaldırarak doğrudan politika modelini tercih verisinden optimize eder.
quiz Sıkça Sorulan Sorular
- check_circle Ödül modeli hangi veriyle eğitilir?: Karşılaştırmalı tercih verisiyle: Aynı isteğe verilen iki yanıt karşılaştırılır, değerlendirici hangisinin daha iyi olduğunu seçer. InstructGPT için OpenAI çalışanları ve konuyla uzman kişiler bu sıralama görevini gerçekleştirdi.
- check_circle Ödül modeli ile politika modeli aynı boyutta mı olmalı?: Olmak zorunda değil, ancak genellikle yakın boyutlar tercih edilir. Çok küçük bir ödül modeli, büyük politika modelinin karmaşık çıktılarını değerlendirmede yetersiz kalabilir.
- check_circle Açık kaynak ödül modeli var mı?: Evet. OpenAssistant ve Open-Instruct projeleri açık kaynak ödül modellerini yayımladı. Anthropic'in Constitutional AI'ı ayrı bir ödül modeli yerine AI geri bildirimi kullanır.