tag PolitikaGradyanı
Bu sayfada PolitikaGradyanı etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
PPO (Proximal Policy Optimization), politika güncellemelerini kırpılmış vekil kayıp (clipped surrogate loss) fonksiyonuyla sınırlı tutarak kararlı ve verimli öğrenme sunan, politika gradyanı tabanlı bir pekiştirmeli öğrenme algoritmasıdır. John Schulman ve ekibi tarafından OpenAI'da 2017'de yayımlanan yöntem (arXiv:1707.06347), TRPO'nun ikinci dereceden optimizasyon gerektiren güven bölgesi (trust region) yaklaşımını birinci dereceden, uygulaması kolay bir mekanizmayla değiştirir: yeni politika eski politikadan belirli bir oranın (tipik olarak ε=0.2) ötesinde saparsa güncelleme kırpılır. PPO iki alanda standart haline geldi. Klasik pekiştirmeli öğrenmede robotik simülasyon (MuJoCo, Isaac Lab), oyun ajanları (OpenAI Five'ın Dota 2 sistemi 2019'da dünya şampiyonunu PPO ile yendi) ve kontrol görevlerinde varsayılan algoritma oldu. Büyük dil modellerinde ise RLHF boru hattının üçüncü adımını oluşturdu: SFT modelinden başlayan politika, ürettiği yanıtlar için ödül modelinden puan alır; KL sapma penaltısı politikayı referans modele yakın tutar ve PPO bu toplam ödülle ağırlıkları günceller. InstructGPT (2022), ChatGPT ve Llama 2-Chat (2023) bu döngüyle hizalandı. 2024-2026 döneminde tablo değişti. Statik tercih verisiyle hizalamada DPO ve türevleri (IPO, KTO, ORPO) düşük maliyetleriyle öne çıkarken, muhakeme modellerinin doğrulanabilir ödüllerle (RLVR) eğitiminde PPO'nun basitleştirilmiş türevi GRPO yükseldi: DeepSeek, R1 modelini (Ocak 2025) değer ağını kaldırıp avantajı grup içi ödül ortalamasından hesaplayan GRPO ile eğitti; DAPO ve Dr. GRPO gibi düzeltmeler 2025-2026'da bu hattı sürdürdü. Yine de bu yöntemlerin tamamı PPO'nun kırpma mantığını miras alır; PPO, modern RL tabanlı LLM eğitiminin ortak atası ve referans noktası olmayı sürdürüyor.