tag InceAyar
Reward Model (Ödül Modeli)
Bu sayfada InceAyar (Reward Model (Ödül Modeli)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritması ile birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini "dondurulmuş" hâlde temsil eder. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. KL sapma penaltısı ve Constitutional AI gibi teknikler bu sorunu hafifletmek için kullanılır.
Reward Model (Ödül Modeli)
Ödül modeli (Reward Model, RM), insanların tercihlerini veya değerlerini sayısal bir ödül sinyaline dönüştüren ve pekiştirmeli öğrenme ile dil modeli hizalama süreçlerinde kullanılan bir sinir ağıdır. RLHF (Reinforcement Learning from Human Feedback) boru hattının ikinci aşamasını oluşturur. Eğitim süreci şöyle çalışır: Bir politika modelinin ürettiği aynı isteğe karşılık gelen birden fazla yanıt, insan değerlendiriciler tarafından tercih sıralamasına konur. Ödül modeli, bu tercih çiftlerini kullanarak hangi yanıtın hangisine göre daha iyi olduğunu öğrenir. Genellikle Bradley-Terry modelini temel alan bir kayıp fonksiyonu kullanılır: model, tercih edilen yanıta yüksek skor, reddedilen yanıta düşük skor vermeyi öğrenir. Eğitilmiş ödül modeli, daha sonra PPO gibi RL algoritması ile birleştirilir: Politika modeli yanıt üretirken ödül modeli üretilen yanıtı puanlar ve bu puan politika modelinin güncellenmesinde kullanılır. Böylece insan değerlendiricilerin her eğitim adımında tekrar geri bildirim vermesi gerekmez; ödül modeli insan tercihlerini "dondurulmuş" hâlde temsil eder. Ödül hacklemesi (reward hacking), modelin gerçek kalite yerine ödül modelini yanıltmayı öğrenmesi sorunudur. KL sapma penaltısı ve Constitutional AI gibi teknikler bu sorunu hafifletmek için kullanılır.
SFT (Supervised Fine-Tuning (Denetimli İnce Ayar))
SFT (Supervised Fine-Tuning — Denetimli İnce Ayar), önceden eğitilmiş (pretrained) bir dil modelinin, (istek, yanıt) çiftlerinden oluşan yüksek kaliteli bir veri kümesiyle talimat izleme yeteneği kazandırmak amacıyla ek eğitime tabi tutulması sürecidir. RLHF boru hattının ilk hizalama adımını oluşturur. Ön eğitim (pretraining) sırasında model yalnızca sonraki kelimeyi tahmin etmeyi öğrenir; bu model herhangi bir talimatı takip edemez. SFT aşamasında model, "Bu metni özetle → Metin: ... → Özet: ..." biçimindeki çiftlerle eğitilir. Standart dil modellemesi kaybı (cross-entropy) kullanılır; ancak yalnızca yanıt tokenleri için kayıp hesaplanır (istek tokenleri maskelenir). SFT veri kümesinin kalitesi son derece önemlidir: InstructGPT'de OpenAI, yalnızca birkaç on bin örneğin yeterli olduğunu göstermiştir. Alpaca gibi projelerde 52.000 GPT-4 üretimi örnek kullanılmıştır; bu, insan yazımı veriyle kıyaslanabilir sonuçlar vermiştir. Modern yaklaşımlar büyük LLM'lerle sentetik veri üretimini içerir. SFT tek başına da güçlü bir hizalama tekniğidir; bazı durumlarda RLHF'ye gerek kalmadan yeterince iyi modeller üretilmektedir. Llama ve Mistral tabanlı açık kaynak modellerin büyük çoğunluğu SFT ile oluşturulmaktadır.