Reinforcement Learning (Pekiştirmeli Öğrenme)

Pekiştirmeli öğrenme, bir ajanın deneme-yanılma ve ödül sinyaliyle en iyi stratejiyi kendi kendine keşfettiği makine öğrenimi dalıdır.

Pekiştirmeli öğrenme (Reinforcement Learning, RL), bir ajanın (agent) bir ortam (environment) içinde eylemler gerçekleştirip aldığı ödül ve ceza sinyallerinden ders çıkararak, uzun vadeli toplam ödülü maksimize eden stratejiyi deneme-yanılma yoluyla kendi kendine öğrendiği makine öğrenimi paradigmasıdır. Denetimli öğrenmeden temel farkı, sisteme "doğru cevabın" hiç gösterilmemesidir: ajan hangi hamlenin iyi olduğunu ancak sonuçlarını yaşayarak keşfeder — tıpkı bir çocuğun bisiklete binmeyi düşe kalka öğrenmesi gibi. RL problemi matematiksel olarak **Markov Karar Süreci (MDP)** ile modellenir: durumlar (state), eylemler (action), geçiş olasılıkları ve ödül fonksiyonu. Ajanın amacı, her duruma en iyi eylemi eşleyen bir **politika (policy)** bulmaktır. Bunu yaparken **keşif-sömürü ikilemi** (exploration-exploitation) ile boğuşur: bilinen iyi hamleyi mi tekrarlamalı, yoksa daha iyisini bulmak için risk mi almalı? Alanın kilometre taşları etkileyicidir. 2013'te DeepMind'ın DQN algoritması Atari oyunlarını ham piksellerden öğrendi; 2016'da AlphaGo, Go dünya şampiyonu Lee Sedol'ü 4-1 yendi; 2017'de AlphaZero yalnızca kendi kendine oynayarak (self-play) satranç, Go ve şogide insan üstü seviyeye 24 saatten kısa sürede ulaştı. 2022'den itibaren RL, büyük dil modellerinin merkezine yerleşti: ChatGPT'yi mümkün kılan **RLHF** (insan geri bildiriminden pekiştirmeli öğrenme), 2024-2026 döneminde ise akıl yürüten modelleri doğuran **RLVR** (doğrulanabilir ödüllerle RL) — OpenAI o1/o3, DeepSeek-R1 ve Claude'un genişletilmiş düşünme yetenekleri bu yaklaşımın ürünüdür. DeepSeek-R1'in GRPO algoritmasıyla, insan etiketli veri olmadan yalnızca matematik ve kod doğruluğunu ödüllendirerek akıl yürütme öğrenmesi, 2025'in en çok konuşulan RL başarılarından biriydi. Bugün RL; robotik (Boston Dynamics, Figure, Tesla Optimus), otonom sürüş (Waymo simülasyon eğitimi), veri merkezi soğutma optimizasyonu (Google'da %40'a varan enerji tasarrufu), çip tasarımı (AlphaChip), matematik olimpiyatları (AlphaProof, IMO 2024'te gümüş madalya seviyesi) ve ajanik yapay zeka sistemlerinin eğitiminde kullanılıyor. Q-learning, SARSA gibi klasik yöntemlerden PPO, SAC, GRPO gibi derin RL algoritmalarına uzanan zengin bir araç kutusuna sahiptir. Yöntemler iki ana eksende sınıflanır. **Değer tabanlı** yaklaşımlar (Q-learning, DQN) her durum-eylem çiftinin uzun vadeli getirisini tahmin eder; **politika tabanlı** yaklaşımlar (REINFORCE, PPO) ise doğrudan eylem seçme stratejisini optimize eder. Actor-critic mimarileri ikisini birleştirir. Ayrıca ortamın bir iç modelini öğrenip planlama yapan **model tabanlı RL** (MuZero, DreamerV3), örnek verimliliğini onlarca kat artırabildiği için robotik gibi gerçek dünya uygulamalarında öne çıkar. Pratikte Gymnasium ve Isaac Lab gibi simülasyon ortamları, Stable-Baselines3 ve Hugging Face TRL gibi kütüphaneler alanın standart araçlarıdır. Alanın teorik temelini Richard Sutton ve Andrew Barto attı; ikili bu katkılarıyla 2024 Turing Ödülü'ne layık görüldü. Sutton'ın ünlü "Bitter Lesson" makalesindeki tez — el yapımı bilgi yerine hesaplama gücüyle ölçeklenen öğrenme ve aramanın her zaman kazandığı — RL'nin bugünkü yükselişinde birebir doğrulanmış durumda. Örnek verimsizliği, seyrek ödüller ve ödül hackleme (reward hacking) hâlâ açık araştırma problemleridir; ancak 2026 itibarıyla RL, sınır modellerin eğitim bütçesinde ön-eğitimle yarışan bir paya ulaşmış durumdadır. Ajanik yapay zekanın — çok adımlı araç kullanan, kod yazan, bilgisayar kullanan sistemlerin — uçtan uca RL ile eğitilmesi, alanın bir sonraki büyük sınavı olarak görülüyor.

Nasıl Çalışır? Ajan-Ortam Döngüsü

RL bir geri bildirim döngüsüdür. Ajan, ortamın anlık durumunu (state) gözlemler ve politikasına göre bir eylem (action) seçer. Ortam bu eyleme yeni bir durum ve sayısal bir ödülle (reward) yanıt verir. Ajan, tek hamlelik ödülü değil, gelecekteki ödüllerin indirgenmiş toplamını (discounted return, γ katsayısıyla) maksimize etmeye çalışır — bugün küçük bir fedakârlık, yarın büyük kazanç getirebilir. Bu uzun vadeli beklentiyi **değer fonksiyonu** (V veya Q) tahmin eder. Örneğin satrançta piyon feda edip vezir kazanmak, anlık ödülü negatif ama toplam getirisi pozitif bir harekettir. Öğrenme, çoğunlukla **zamansal fark (TD) hatası** üzerinden ilerler: "beklediğim ödül ile gerçekleşen arasındaki fark" politika güncellemesinin sinyalidir. Bu döngü milyonlarca kez tekrarlanır; AlphaZero eğitiminde 44 milyon self-play oyunu oynanmıştır.

Temel Bileşenler ve Kavramlar

  • check_circle Ajan (Agent): Kararları veren öğrenen sistem. Oyun oynayan sinir ağı, ticaret botu, robot kontrolcüsü veya bir dil modeli olabilir.
  • check_circle Ortam (Environment): Ajanın etkileştiği dünya; eylemlere yeni durum ve ödülle yanıt verir. Simülasyon (MuJoCo, Isaac Gym) veya gerçek dünya olabilir.
  • check_circle Durum ve Eylem (State/Action): Durum ortamın anlık temsili; eylem ajanın seçenekleridir. Eylem uzayı ayrık (oyun hamleleri) veya sürekli (robot eklem torkları) olabilir.
  • check_circle Ödül (Reward): Her adımda alınan sayısal geri bildirim. Ödül fonksiyonu tasarımı kritiktir; kötü tasarım ödül hacklemeye yol açar.
  • check_circle Politika (Policy, π): Durumdan eyleme eşleme stratejisi. Derin RL'de bir sinir ağıyla temsil edilir; öğrenmenin hedefi optimal politikayı bulmaktır.
  • check_circle Değer Fonksiyonu (V, Q): Bir durumun veya durum-eylem çiftinin uzun vadeli beklenen getirisini tahmin eder. Q-learning adını Q fonksiyonundan alır.
  • check_circle Keşif-Sömürü Dengesi: Bilinen iyi eylemi kullanmak (exploitation) ile yenisini denemek (exploration) arasındaki ödünleşim. ε-greedy ve entropi bonusu yaygın çözümlerdir.

Öne Çıkan Algoritmalar

q-learning Q-Learning / DQN

Tablo tabanlı klasik yöntem ve derin ağlı hâli. DQN, 2013'te Atari oyunlarını ham pikselden öğrenerek derin RL çağını başlattı.

ppo PPO

OpenAI'ın 2017 tarihli Proximal Policy Optimization algoritması; kararlılığıyla RLHF dahil endüstrinin varsayılan tercihi oldu.

sac SAC

Soft Actor-Critic; sürekli eylem uzaylarında (robotik) örnek verimliliği ve entropi temelli keşif dengesiyle öne çıkar.

grpo GRPO

DeepSeek'in Group Relative Policy Optimization yöntemi; ayrı değer ağı gerektirmeden LLM akıl yürütme eğitiminde standartlaştı (R1, 2025).

alphazero AlphaZero / MCTS

Self-play ile Monte Carlo Ağaç Aramasını birleştirir; satranç, Go ve şogide sıfırdan insan üstü seviyeye ulaştı.

model-based Model Tabanlı RL

DreamerV3 ve MuZero gibi yöntemler ortamın iç modelini öğrenip planlama yapar; örnek verimliliğinde büyük kazanç getirir.

RLHF ve RLVR: Dil Modellerinin Motoru

2022 sonrası RL'nin en görünür uygulaması dil modelleridir. **RLHF** sürecinde insan değerlendiriciler model yanıtlarını sıralar, bu tercihlerden bir ödül modeli eğitilir ve politika (LLM) genellikle PPO ile bu ödüle göre optimize edilir; ChatGPT'yi ham GPT-3'ten ayıran adım buydu. Anthropic'in RLAIF/Anayasal YZ yaklaşımı insan yerine yazılı ilkelere göre değerlendiren bir yapay zekayı kullanır. 2024-2026'nın büyük sıçraması ise **RLVR** (Reinforcement Learning from Verifiable Rewards) oldu: matematik cevabının doğruluğu veya kodun testleri geçmesi gibi otomatik doğrulanabilir sinyaller ödül olarak kullanılır. OpenAI o1/o3, DeepSeek-R1, Gemini 2.5 ve Claude'un akıl yürütme modları bu tarifle eğitildi. DeepSeek-R1-Zero, hiç denetimli ince ayar olmadan saf RL ile uzun düşünme zincirleri geliştirerek yaklaşımın gücünü kanıtladı. 2026'da ajanik RL — çok adımlı araç kullanımı ve bilgisayar kullanımının uçtan uca RL ile eğitilmesi — sınır laboratuvarların ana yatırım alanıdır.

Gerçek Dünya Uygulamaları

robotics Robotik

Boston Dynamics Atlas, Figure ve Tesla Optimus; yürüme ve manipülasyonu GPU simülasyonlarında (Isaac Gym) RL ile öğrenip gerçeğe aktarır.

chip Çip Tasarımı

Google AlphaChip, TPU yerleşim planlarını RL ile saatler içinde üretir; insan mühendislerin haftalar süren işini kısalttı.

energy Enerji Optimizasyonu

DeepMind'ın RL sistemi Google veri merkezlerinde soğutma enerjisini %40'a varan oranda düşürdü.

auto Otonom Sürüş

Waymo ve Tesla, sürüş politikalarını milyarlarca simülasyon kilometresinde RL ve taklit öğrenme karışımıyla eğitir.

math Bilimsel Keşif

AlphaProof IMO 2024'te gümüş madalya seviyesine ulaştı; AlphaTensor daha hızlı matris çarpım algoritmaları keşfetti.

finance Finans ve Öneri

Portföy dengeleme, dinamik fiyatlama ve YouTube/TikTok tarzı öneri sistemlerinde uzun vadeli kullanıcı değeri RL ile optimize edilir.

Zorluklar ve Açık Problemler

RL'nin en bilinen sorunu **örnek verimsizliğidir**: bir insanın dakikalar içinde kavradığı oyunu klasik ajanlar milyonlarca denemede öğrenir; bu yüzden gerçek dünya yerine simülasyon şarttır, o da **sim-to-real** aktarım sorununu doğurur. **Seyrek ödül** problemi — ödülün yalnızca uzun bir görev sonunda gelmesi — kredi atama işini zorlaştırır; ödül şekillendirme ve içsel motivasyon (curiosity) bu boşluğu doldurmaya çalışır. En sinsi sorun **ödül hacklemedir** (reward hacking): ajan, ödül fonksiyonundaki açığı bulup amacı çarpıtır — tekne yarışı oyununda tur atmak yerine bonus toplayarak dönüp duran ajan klasik örnektir. LLM eğitiminde bu, ödül modelini kandıran dalkavuk (sycophantic) yanıtlar veya doğrulayıcıyı aldatan çözümler olarak ortaya çıkar ve yapay zeka hizalama araştırmasının merkezindedir. Eğitim kararsızlığı, hiperparametre hassasiyeti ve çok ajanlı ortamlarda durağan olmayan dinamikler diğer aktif araştırma başlıklarıdır.

Sık Sorulan Sorular

  • check_circle Pekiştirmeli öğrenme nedir, basitçe nasıl açıklanır?: Bir ajanın ortamda eylemler deneyip aldığı ödül ve cezalardan ders çıkararak en iyi stratejiyi kendi kendine bulduğu öğrenme türüdür. Evcil hayvana ödül mamasıyla numara öğretmeye benzer: doğru davranış ödüllendirilir, ajan ödülü artıran davranışı tekrarlar.
  • check_circle Pekiştirmeli öğrenme ile denetimli öğrenme arasındaki fark nedir?: Denetimli öğrenmede model, doğru cevapları içeren etiketli veriyle eğitilir. RL'de doğru cevap önceden verilmez; ajan yalnızca gecikmeli bir ödül sinyali alır ve doğruyu deneme-yanılmayla keşfeder. Ayrıca RL'de ajanın eylemleri, göreceği bir sonraki veriyi de değiştirir.
  • check_circle RLHF nedir ve ChatGPT ile ilişkisi nedir?: RLHF, insan değerlendiricilerin yanıt tercihlerinden bir ödül modeli eğitip dil modelini bu ödüle göre (genellikle PPO ile) optimize etme sürecidir. Ham GPT-3'ü yardımsever ve güvenli ChatGPT'ye dönüştüren adım budur; Claude ve Gemini de benzer yöntemler kullanır.
  • check_circle RLVR nedir, neden 2025-2026'da bu kadar konuşuluyor?: RLVR, matematik cevabı veya kod testleri gibi otomatik doğrulanabilir sinyalleri ödül olarak kullanan RL yaklaşımıdır. OpenAI o1/o3 ve DeepSeek-R1 gibi akıl yürüten modellerin uzun düşünme zincirlerini bu yöntem ortaya çıkardı; insan etiketine bağımlılığı azalttığı için ölçeklenmesi kolaydır.
  • check_circle Derin pekiştirmeli öğrenme (Deep RL) nedir?: Klasik RL'nin tablo tabanlı değer temsillerinin yerine derin sinir ağlarının kullanılmasıdır. DQN'in 2013'te Atari oyunlarını ham pikselden öğrenmesiyle başladı; AlphaGo, PPO ve günümüz LLM eğitimlerinin tamamı derin RL örneğidir.
  • check_circle Pekiştirmeli öğrenmeyi öğrenmeye nereden başlamalıyım?: Sutton ve Barto'nun 'Reinforcement Learning: An Introduction' kitabı standart kaynaktır. Pratik için Python'da Gymnasium (eski OpenAI Gym) ortamları ve Stable-Baselines3 kütüphanesi; LLM tarafı için Hugging Face TRL kütüphanesi iyi başlangıç noktalarıdır.