GRPO (Grup Göreli Politika Optimizasyonu)

Değer modeli eğitmeye gerek duymadan, aynı sorguya üretilen yanıt grubunun ortalama ödülünü baz alarak LLM politikasını güncelleyen pekiştirmeli öğrenme algoritması.

GRPO (Group Relative Policy Optimization / Grup Göreli Politika Optimizasyonu), büyük dil modellerini pekiştirmeli öğrenme ile ince ayarlamak için geliştirilmiş verimli bir algoritmadır. İlk olarak DeepSeek'in 2024 tarihli DeepSeekMath makalelerinde tanıtılan bu yöntem, Ocak 2025'te yayımlanan DeepSeek-R1 modeli sayesinde geniş yapay zeka camiasının dikkatini çekti. Geleneksel PPO (Proximal Policy Optimization) yönteminde, ince ayar sürecinde politika modelinin yanı sıra ayrı bir değer (critic) modeli de eğitilir. Bu değer modeli, belirli bir durum için beklenen kümülatif ödülü tahmin eder ve öğrenme sinyalini kararlı kılar. Ancak bu yaklaşım, politika modeli kadar parametre içerebilen ikinci bir modelin GPU belleğine ve hesaplama kaynaklarına sığdırılmasını gerektirir. GRPO, bu değer modelini tamamen ortadan kaldırır ve yerine grup tabanlı bir karşılaştırma mekanizması koyar. GRPO'nun çalışma mekanizması şöyledir: Eğitim sırasında her sorgu için politika modeli birden fazla (genellikle 4 ila 16) bağımsız yanıt örnekler. Her yanıt, kural tabanlı veya model tabanlı bir ödül fonksiyonu tarafından puanlanır; matematik sorularında doğru cevap kontrol edilebilir, kod sorularında birim testleri çalıştırılabilir, biçim uygunluğu değerlendirilebilir. Her yanıtın avantajı, grup içindeki ortalama ödül çıkarılarak ve grubun standart sapmasına bölünerek hesaplanır. Bu normalize edilmiş avantajlar, PPO'nun kırpılmış politika gradyanı güncelleme kuralıyla birleştirilir ve model parametreleri güncellenir. GRPO'nun başlıca avantajları şunlardır: Değer modeli eğitilmediğinden GPU belleği ve hesaplama maliyeti önemli ölçüde azalır; bu da daha büyük politika modelleriyle ya da daha dar bütçelerle çalışmayı mümkün kılar. Grup içi karşılaştırma, modelin kendi üretimlerini birbirleriyle kıyaslamasını sağlar ve daha tutarlı bir öğrenme sinyali oluşturur. Kural tabanlı ödül fonksiyonları kullanıldığında insan etiketine olan bağımlılık azalır. Buna karşın yöntemin sınırlılıkları da vardır: Grup büyüklüğü ve ödül fonksiyonu tasarımı kritik hiperparametrelerdir; hatalı ödüller hızla yayılabilir. GRPO, DeepSeek-R1'in başarısının ardından açık kaynaklı LLM eğitim ekosisteminde hızla benimsenmiş; TRL, Verl ve OpenRLHF gibi kütüphaneler GRPO desteği eklemiştir. Günümüzde bu algoritma, reasoning model eğitiminin standart araç kutusunun bir parçası haline gelmiştir.