Nasıl Çalışır? Ajan-Ortam Döngüsü
RL bir geri bildirim döngüsüdür. Ajan, ortamın anlık durumunu (state) gözlemler ve politikasına göre bir eylem (action) seçer. Ortam bu eyleme yeni bir durum ve sayısal bir ödülle (reward) yanıt verir. Ajan, tek hamlelik ödülü değil, gelecekteki ödüllerin indirgenmiş toplamını (discounted return, γ katsayısıyla) maksimize etmeye çalışır — bugün küçük bir fedakârlık, yarın büyük kazanç getirebilir. Bu uzun vadeli beklentiyi **değer fonksiyonu** (V veya Q) tahmin eder. Örneğin satrançta piyon feda edip vezir kazanmak, anlık ödülü negatif ama toplam getirisi pozitif bir harekettir. Öğrenme, çoğunlukla **zamansal fark (TD) hatası** üzerinden ilerler: "beklediğim ödül ile gerçekleşen arasındaki fark" politika güncellemesinin sinyalidir. Bu döngü milyonlarca kez tekrarlanır; AlphaZero eğitiminde 44 milyon self-play oyunu oynanmıştır.
Temel Bileşenler ve Kavramlar
- check_circle Ajan (Agent): Kararları veren öğrenen sistem. Oyun oynayan sinir ağı, ticaret botu, robot kontrolcüsü veya bir dil modeli olabilir.
- check_circle Ortam (Environment): Ajanın etkileştiği dünya; eylemlere yeni durum ve ödülle yanıt verir. Simülasyon (MuJoCo, Isaac Gym) veya gerçek dünya olabilir.
- check_circle Durum ve Eylem (State/Action): Durum ortamın anlık temsili; eylem ajanın seçenekleridir. Eylem uzayı ayrık (oyun hamleleri) veya sürekli (robot eklem torkları) olabilir.
- check_circle Ödül (Reward): Her adımda alınan sayısal geri bildirim. Ödül fonksiyonu tasarımı kritiktir; kötü tasarım ödül hacklemeye yol açar.
- check_circle Politika (Policy, π): Durumdan eyleme eşleme stratejisi. Derin RL'de bir sinir ağıyla temsil edilir; öğrenmenin hedefi optimal politikayı bulmaktır.
- check_circle Değer Fonksiyonu (V, Q): Bir durumun veya durum-eylem çiftinin uzun vadeli beklenen getirisini tahmin eder. Q-learning adını Q fonksiyonundan alır.
- check_circle Keşif-Sömürü Dengesi: Bilinen iyi eylemi kullanmak (exploitation) ile yenisini denemek (exploration) arasındaki ödünleşim. ε-greedy ve entropi bonusu yaygın çözümlerdir.
Öne Çıkan Algoritmalar
q-learning Q-Learning / DQN
Tablo tabanlı klasik yöntem ve derin ağlı hâli. DQN, 2013'te Atari oyunlarını ham pikselden öğrenerek derin RL çağını başlattı.
ppo PPO
OpenAI'ın 2017 tarihli Proximal Policy Optimization algoritması; kararlılığıyla RLHF dahil endüstrinin varsayılan tercihi oldu.
sac SAC
Soft Actor-Critic; sürekli eylem uzaylarında (robotik) örnek verimliliği ve entropi temelli keşif dengesiyle öne çıkar.
grpo GRPO
DeepSeek'in Group Relative Policy Optimization yöntemi; ayrı değer ağı gerektirmeden LLM akıl yürütme eğitiminde standartlaştı (R1, 2025).
alphazero AlphaZero / MCTS
Self-play ile Monte Carlo Ağaç Aramasını birleştirir; satranç, Go ve şogide sıfırdan insan üstü seviyeye ulaştı.
model-based Model Tabanlı RL
DreamerV3 ve MuZero gibi yöntemler ortamın iç modelini öğrenip planlama yapar; örnek verimliliğinde büyük kazanç getirir.
RLHF ve RLVR: Dil Modellerinin Motoru
2022 sonrası RL'nin en görünür uygulaması dil modelleridir. **RLHF** sürecinde insan değerlendiriciler model yanıtlarını sıralar, bu tercihlerden bir ödül modeli eğitilir ve politika (LLM) genellikle PPO ile bu ödüle göre optimize edilir; ChatGPT'yi ham GPT-3'ten ayıran adım buydu. Anthropic'in RLAIF/Anayasal YZ yaklaşımı insan yerine yazılı ilkelere göre değerlendiren bir yapay zekayı kullanır. 2024-2026'nın büyük sıçraması ise **RLVR** (Reinforcement Learning from Verifiable Rewards) oldu: matematik cevabının doğruluğu veya kodun testleri geçmesi gibi otomatik doğrulanabilir sinyaller ödül olarak kullanılır. OpenAI o1/o3, DeepSeek-R1, Gemini 2.5 ve Claude'un akıl yürütme modları bu tarifle eğitildi. DeepSeek-R1-Zero, hiç denetimli ince ayar olmadan saf RL ile uzun düşünme zincirleri geliştirerek yaklaşımın gücünü kanıtladı. 2026'da ajanik RL — çok adımlı araç kullanımı ve bilgisayar kullanımının uçtan uca RL ile eğitilmesi — sınır laboratuvarların ana yatırım alanıdır.
Gerçek Dünya Uygulamaları
robotics Robotik
Boston Dynamics Atlas, Figure ve Tesla Optimus; yürüme ve manipülasyonu GPU simülasyonlarında (Isaac Gym) RL ile öğrenip gerçeğe aktarır.
chip Çip Tasarımı
Google AlphaChip, TPU yerleşim planlarını RL ile saatler içinde üretir; insan mühendislerin haftalar süren işini kısalttı.
energy Enerji Optimizasyonu
DeepMind'ın RL sistemi Google veri merkezlerinde soğutma enerjisini %40'a varan oranda düşürdü.
auto Otonom Sürüş
Waymo ve Tesla, sürüş politikalarını milyarlarca simülasyon kilometresinde RL ve taklit öğrenme karışımıyla eğitir.
math Bilimsel Keşif
AlphaProof IMO 2024'te gümüş madalya seviyesine ulaştı; AlphaTensor daha hızlı matris çarpım algoritmaları keşfetti.
finance Finans ve Öneri
Portföy dengeleme, dinamik fiyatlama ve YouTube/TikTok tarzı öneri sistemlerinde uzun vadeli kullanıcı değeri RL ile optimize edilir.
Zorluklar ve Açık Problemler
RL'nin en bilinen sorunu **örnek verimsizliğidir**: bir insanın dakikalar içinde kavradığı oyunu klasik ajanlar milyonlarca denemede öğrenir; bu yüzden gerçek dünya yerine simülasyon şarttır, o da **sim-to-real** aktarım sorununu doğurur. **Seyrek ödül** problemi — ödülün yalnızca uzun bir görev sonunda gelmesi — kredi atama işini zorlaştırır; ödül şekillendirme ve içsel motivasyon (curiosity) bu boşluğu doldurmaya çalışır. En sinsi sorun **ödül hacklemedir** (reward hacking): ajan, ödül fonksiyonundaki açığı bulup amacı çarpıtır — tekne yarışı oyununda tur atmak yerine bonus toplayarak dönüp duran ajan klasik örnektir. LLM eğitiminde bu, ödül modelini kandıran dalkavuk (sycophantic) yanıtlar veya doğrulayıcıyı aldatan çözümler olarak ortaya çıkar ve yapay zeka hizalama araştırmasının merkezindedir. Eğitim kararsızlığı, hiperparametre hassasiyeti ve çok ajanlı ortamlarda durağan olmayan dinamikler diğer aktif araştırma başlıklarıdır.
Sık Sorulan Sorular
- check_circle Pekiştirmeli öğrenme nedir, basitçe nasıl açıklanır?: Bir ajanın ortamda eylemler deneyip aldığı ödül ve cezalardan ders çıkararak en iyi stratejiyi kendi kendine bulduğu öğrenme türüdür. Evcil hayvana ödül mamasıyla numara öğretmeye benzer: doğru davranış ödüllendirilir, ajan ödülü artıran davranışı tekrarlar.
- check_circle Pekiştirmeli öğrenme ile denetimli öğrenme arasındaki fark nedir?: Denetimli öğrenmede model, doğru cevapları içeren etiketli veriyle eğitilir. RL'de doğru cevap önceden verilmez; ajan yalnızca gecikmeli bir ödül sinyali alır ve doğruyu deneme-yanılmayla keşfeder. Ayrıca RL'de ajanın eylemleri, göreceği bir sonraki veriyi de değiştirir.
- check_circle RLHF nedir ve ChatGPT ile ilişkisi nedir?: RLHF, insan değerlendiricilerin yanıt tercihlerinden bir ödül modeli eğitip dil modelini bu ödüle göre (genellikle PPO ile) optimize etme sürecidir. Ham GPT-3'ü yardımsever ve güvenli ChatGPT'ye dönüştüren adım budur; Claude ve Gemini de benzer yöntemler kullanır.
- check_circle RLVR nedir, neden 2025-2026'da bu kadar konuşuluyor?: RLVR, matematik cevabı veya kod testleri gibi otomatik doğrulanabilir sinyalleri ödül olarak kullanan RL yaklaşımıdır. OpenAI o1/o3 ve DeepSeek-R1 gibi akıl yürüten modellerin uzun düşünme zincirlerini bu yöntem ortaya çıkardı; insan etiketine bağımlılığı azalttığı için ölçeklenmesi kolaydır.
- check_circle Derin pekiştirmeli öğrenme (Deep RL) nedir?: Klasik RL'nin tablo tabanlı değer temsillerinin yerine derin sinir ağlarının kullanılmasıdır. DQN'in 2013'te Atari oyunlarını ham pikselden öğrenmesiyle başladı; AlphaGo, PPO ve günümüz LLM eğitimlerinin tamamı derin RL örneğidir.
- check_circle Pekiştirmeli öğrenmeyi öğrenmeye nereden başlamalıyım?: Sutton ve Barto'nun 'Reinforcement Learning: An Introduction' kitabı standart kaynaktır. Pratik için Python'da Gymnasium (eski OpenAI Gym) ortamları ve Stable-Baselines3 kütüphanesi; LLM tarafı için Hugging Face TRL kütüphanesi iyi başlangıç noktalarıdır.