PPO, politika güncellemelerini kırpılmış kayıpla sınırlayarak kararlı pekiştirmeli öğrenme yapan ve RLHF'de kullanılan algoritmadır.

PPO (Proximal Policy Optimization), politika güncellemelerini kırpılmış vekil kayıp (clipped surrogate loss) fonksiyonuyla sınırlı tutarak kararlı ve verimli öğrenme sunan, politika gradyanı tabanlı bir pekiştirmeli öğrenme algoritmasıdır. John Schulman ve ekibi tarafından OpenAI'da 2017'de yayımlanan yöntem (arXiv:1707.06347), TRPO'nun ikinci dereceden optimizasyon gerektiren güven bölgesi (trust region) yaklaşımını birinci dereceden, uygulaması kolay bir mekanizmayla değiştirir: yeni politika eski politikadan belirli bir oranın (tipik olarak ε=0.2) ötesinde saparsa güncelleme kırpılır. PPO iki alanda standart haline geldi. Klasik pekiştirmeli öğrenmede robotik simülasyon (MuJoCo, Isaac Lab), oyun ajanları (OpenAI Five'ın Dota 2 sistemi 2019'da dünya şampiyonunu PPO ile yendi) ve kontrol görevlerinde varsayılan algoritma oldu. Büyük dil modellerinde ise RLHF boru hattının üçüncü adımını oluşturdu: SFT modelinden başlayan politika, ürettiği yanıtlar için ödül modelinden puan alır; KL sapma penaltısı politikayı referans modele yakın tutar ve PPO bu toplam ödülle ağırlıkları günceller. InstructGPT (2022), ChatGPT ve Llama 2-Chat (2023) bu döngüyle hizalandı. 2024-2026 döneminde tablo değişti. Statik tercih verisiyle hizalamada DPO ve türevleri (IPO, KTO, ORPO) düşük maliyetleriyle öne çıkarken, muhakeme modellerinin doğrulanabilir ödüllerle (RLVR) eğitiminde PPO'nun basitleştirilmiş türevi GRPO yükseldi: DeepSeek, R1 modelini (Ocak 2025) değer ağını kaldırıp avantajı grup içi ödül ortalamasından hesaplayan GRPO ile eğitti; DAPO ve Dr. GRPO gibi düzeltmeler 2025-2026'da bu hattı sürdürdü. Yine de bu yöntemlerin tamamı PPO'nun kırpma mantığını miras alır; PPO, modern RL tabanlı LLM eğitiminin ortak atası ve referans noktası olmayı sürdürüyor.

PPO Nasıl Çalışır? Kırpılmış Kayıp Mekanizması

PPO'nun çekirdeği, politika gradyanı yöntemlerinin kararsız büyük güncellemeler sorununu çözen kırpma mekanizmasıdır. Önce yeni politika ile eski politika arasındaki olasılık oranı hesaplanır: r_t = π_θ(a|s) / π_θ_old(a|s). Kayıp fonksiyonu bu oranı avantaj tahmini A_t ile çarpar, ama oranı [1-ε, 1+ε] aralığına kırpar: L_CLIP = E[min(r_t · A_t, clip(r_t, 1-ε, 1+ε) · A_t)]. ε genellikle 0.2 seçilir; yani tek güncellemede politika en fazla %20 kayabilir. Avantaj tahmini için çoğu uygulama GAE (Generalized Advantage Estimation, λ≈0.95) kullanır ve bunun için ayrı bir değer (critic) ağı eğitilir. Aynı veri yığını üzerinde 3-10 epoch mini-batch güncellemesi yapılabilmesi, PPO'yu örneklem açısından vanilla policy gradient'ten belirgin biçimde verimli kılar. Toplam kayba genellikle değer kaybı (c1≈0.5) ve keşfi teşvik eden entropi bonusu (c2≈0.01) da eklenir.

PPO vs Diğer RL Algoritmaları

bolt REINFORCE

En basit politika gradyanı yöntemi; yüksek varyans ve kararsız eğitimle bilinir. PPO bu temelin üzerine kırpma ve avantaj tahmini ekler.

functions TRPO (2015)

Güven bölgesi garantisini KL kısıtıyla kurar ama ikinci dereceden optimizasyon (conjugate gradient) gerektirir; hesaplama maliyeti yüksektir.

content-cut PPO (2017)

TRPO benzeri kararlılığı birinci dereceden optimizasyonla, tek satırlık clip işlemiyle elde eder. Uygulaması kolay, geniş görev yelpazesinde güçlü.

swap DPO (2023)

Ayrı ödül modeli ve RL döngüsü kurmadan tercih çiftlerinden doğrudan öğrenir. Statik veriyle hizalamada PPO'dan çok daha ucuzdur.

groups GRPO (2024)

Değer ağını kaldırır, avantajı aynı istem için üretilen yanıt grubunun ödül ortalamasına göre hesaplar. DeepSeek-R1'in muhakeme eğitiminin motoru.

RLHF'de PPO Boru Hattı Adım Adım

  • check_circle 1. Başlangıç politikası: SFT modeli hem başlangıç politikası (π_θ) hem de dondurulmuş KL referansı (π_ref) olarak kopyalanır; bu, temel talimat izleme yeteneğini korur.
  • check_circle 2. Yanıt üretimi (rollout): Politika, istem havuzundan gelen her istek için yanıt üretir; bu online örnekleme PPO'yu DPO'dan ayıran temel özelliktir.
  • check_circle 3. Ödül hesabı: Ödül modeli puanından token bazlı KL penaltısı düşülür: r = r_RM − β·KL(π_θ‖π_ref). KL terimi dil bozulmasını ve ödül hacklemesini (reward hacking) frenler.
  • check_circle 4. PPO güncellemesi: Avantajlar GAE ile tahmin edilir, kırpılmış kayıpla politika ve değer ağı birkaç epoch güncellenir; sonra döngü binlerce adım tekrarlanır.
  • check_circle Bellek maliyeti: Politika, referans, ödül ve değer olmak üzere dört model aynı anda bellekte tutulur; 70B ölçeğinde bu, DPO'ya göre kabaca 2-4 kat GPU belleği demektir.
  • check_circle Hiperparametre hassasiyeti: ε (clip), β (KL katsayısı) ve öğrenme hızı kritik ayarlardır; kötü seçimler eğitimi kararsızlaştırır veya ödül hacklemesine yol açar.

PPO Pratikte: Kütüphaneler ve Kod

PPO'yu sıfırdan yazmak gerekmez. Klasik RL problemlerinde (robotik simülasyon, oyun ortamları, kontrol) Stable Baselines3, CleanRL ve Ray RLlib hazır uygulamalar sunar; Gymnasium ortamlarında `PPO("MlpPolicy", env).learn(1_000_000)` gibi birkaç satırla eğitim başlar. LLM tarafında Hugging Face TRL'in PPOTrainer sınıfı politika, ödül ve referans modellerini tek döngüde birleştirir; büyük ölçekte ise verl (ByteDance) ve OpenRLHF, vLLM tabanlı hızlı rollout üretimiyle 2025-2026'nın en yaygın RL eğitim çatıları haline geldi. Seçim kuralı pratikte nettir: elinizde yalnızca statik tercih çiftleri varsa DPO ile başlayın; ödül eğitim sırasında dinamik hesaplanabiliyorsa — birim testi geçen kod, doğru matematik cevabı gibi doğrulanabilir sinyaller veya güçlü bir ödül modeli — PPO ya da GRPO'nun online yapısı daha yüksek tavan sunar. Küçük bir modelle (1-8B) ve düşük öğrenme hızıyla (1e-6 civarı) başlayıp KL eğrisini izlemek, en sık verilen mühendislik tavsiyesidir.

2026'da PPO: GRPO, RLVR ve Muhakeme Modelleri

RL tabanlı LLM eğitiminin ağırlık merkezi, insan tercihlerinden doğrulanabilir ödüllere (RLVR) kaydı ve bu dalganın motoru PPO ailesi oldu. DeepSeek-R1 (Ocak 2025), matematik ve kod ödülleriyle GRPO kullanarak uzun düşünme zincirlerinin saf RL ile ortaya çıkabildiğini gösterdi; DeepSeek-V3.2 ve R1 türevleri bu hattı sürdürdü. 2025'te DAPO (clip-higher, dinamik örnekleme) ve Dr. GRPO (uzunluk yanlılığı düzeltmesi) gibi çalışmalar GRPO'nun kırpma ve normalizasyon detaylarını iyileştirdi; Qwen ve Llama ekosistemindeki açık muhakeme modellerinin çoğu bu türevlerle eğitiliyor. OpenAI'ın o-serisi ve GPT-5.x muhakeme eğitimi, Google'ın Gemini modelleri ve Anthropic'in RL boru hatları da politika gradyanı temelli büyük ölçekli RL kullanıyor; kamuya açık detaylar sınırlı olsa da hepsinin kavramsal temeli PPO'nun kırpılmış güncelleme fikrine dayanıyor. Özetle PPO saf haliyle LLM eğitiminde eskisi kadar sık görülmese de, 2026'nın muhakeme modellerini eğiten algoritmaların ortak atası konumunda.

Sık Sorulan Sorular

  • check_circle PPO nedir?: PPO (Proximal Policy Optimization), 2017'de OpenAI'da geliştirilen, kırpılmış vekil kayıp fonksiyonuyla politika güncellemelerini sınırlı tutarak kararlı eğitim yapan politika gradyanı tabanlı bir pekiştirmeli öğrenme algoritmasıdır.
  • check_circle PPO ne işe yarar?: Bir ajanın deneme-yanılma yoluyla ödülü en üst düzeye çıkaran davranışlar öğrenmesini mümkün kılar. Robotik kontrol ve oyun ajanlarının yanı sıra RLHF'de dil modellerini insan tercihlerine hizalamak için kullanılır.
  • check_circle PPO ile DPO arasındaki fark nedir?: PPO ayrı bir ödül modeli, değer ağı ve online RL döngüsü gerektirir; DPO tercih çiftlerinden doğrudan öğrenir. DPO daha basit ve ucuzdur, PPO ise eğitim sırasında üretilen yanıtlar üzerinden dinamik ödül sinyalinden yararlanabilir.
  • check_circle PPO ile GRPO arasındaki fark nedir?: GRPO, PPO'daki değer (critic) ağını kaldırır ve avantajı aynı istem için üretilen yanıt grubunun ödül ortalamasına göre hesaplar. Bellek maliyetini düşürür; DeepSeek-R1 gibi muhakeme modellerinin eğitiminde tercih edildi.
  • check_circle PPO'da clip (kırpma) oranı ne işe yarar?: Olasılık oranını [1-ε, 1+ε] aralığında tutarak tek adımda politikanın aşırı değişmesini engeller. ε=0.2 en yaygın değerdir; küçük ε daha temkinli, büyük ε daha agresif güncelleme demektir.
  • check_circle PPO hâlâ kullanılıyor mu?: Evet. Robotik ve klasik RL'de varsayılan algoritma olmayı sürdürüyor; LLM tarafında saf PPO yerini büyük ölçüde GRPO, DAPO gibi türevlerine bıraktı ama bunların tamamı PPO'nun kırpma mantığı üzerine kurulu.