Markov Decision Process (MDP) (Markov Karar Süreci)

Pekiştirmeli öğrenmenin matematiksel çerçevesi: durum, eylem, geçiş olasılıkları ve ödüller aracılığıyla optimal karar politikası tanımlar.

Markov Karar Süreci (Markov Decision Process — MDP), pekiştirmeli öğrenmenin matematiksel temelini oluşturan karar teorisi çerçevesidir. MDP, bir ajanın (agent) olası durumlar (states), eylemler (actions), geçiş olasılıkları (transition probabilities) ve ödüller (rewards) aracılığıyla stokastik bir çevreyle etkileşimini formalize eder. Bir MDP dört temel bileşenden oluşur: S (durum uzayı), A (eylem uzayı), P(s'|s,a) (durum geçiş olasılıkları) ve R(s,a) (anlık ödül fonksiyonu). Buna ek olarak bir gamma (γ) indirim faktörü, gelecekteki ödüllerin mevcut değerini belirler. Markov özelliği, bir sonraki durumun yalnızca mevcut duruma ve seçilen eyleme bağlı olduğunu, geçmiş tarih bilgisine gerek olmadığını ifade eder. Bu özellik hesaplamayı büyük ölçüde basitleştirir ve çözüm algoritmalarının pratik uygulanabilirliğini garanti eder. MDP'nin çözümü, beklenen toplam ödülü en üst düzeye çıkaran bir politika (policy) π: S → A bulmayı gerektirir. Bellman optimality denklemleri, bu politikayı bulmak için temel matematiksel araçları sunar. Değer iterasyonu (value iteration) ve politika iterasyonu (policy iteration) algoritmaları, sonlu ve küçük durum uzaylarında kesin çözüm hesaplar. Büyük veya sürekli durum uzaylarında ise Q-learning, SARSA ve derin pekiştirmeli öğrenme (Deep RL) algoritmaları yaklaşık çözümler bulur; bu algoritmalar durum değer fonksiyonlarını sinir ağlarıyla yaklaştırarak milyonlarca durum-eylem çiftini yönetilebilir hale getirir. MDP'nin gerçek dünya uygulamaları son derece geniştir: satranç ve Go gibi oyunlarda (AlphaGo, AlphaZero), robot lokomotif kontrolünde, otonom araç yol planlamasında, ilaç dozlama optimizasyonunda ve öneri sistemlerinde temel çerçeve olarak işlev görür. Kısmi gözlemlenebilir ortamlarda ise POMDP (Partially Observable MDP) uzantısı kullanılır; ajan çevrenin tam durumunu değil yalnızca gürültülü gözlemleri bilir ve bunun üzerine inanç durumları (belief states) oluşturarak karar alır. Hem deterministik hem stokastik ortamlar için güçlü bir matematiksel temel oluşturan MDP, modern yapay zeka araştırmalarının vazgeçilmez çerçevesi olmayı sürdürmektedir.

MDP Nedir?

Markov Karar Süreci (MDP), bir ajanın stokastik bir çevreyle etkileşimini matematiksel olarak modelleyen karar teorisi çerçevesidir. Durum (S), eylem (A), geçiş olasılıkları (P) ve ödül (R) bileşenleriyle tanımlanır; pekiştirmeli öğrenmenin temel matematiksel altyapısını oluşturur.

Temel Bileşenler

Durum Uzayı (S)

Ajanın içinde bulunabileceği tüm olası durumların kümesi; sonlu veya sürekli olabilir.

Eylem Uzayı (A)

Her durumda ajanın seçebileceği eylemler; deterministik veya stokastik politikayla seçilir.

Geçiş Fonksiyonu P

P(s'|s,a): s durumunda a eylemi gerçekleştirildiğinde s' durumuna geçiş olasılığı.

Ödül Fonksiyonu R

R(s,a): s durumunda a eylemi sonrası alınan anlık sayısal ödül; maximize edilmek istenir.

Çözüm Algoritmaları

Bellman optimality denklemleri MDP'nin matematiksel çözümünü tanımlar. Değer iterasyonu ve politika iterasyonu küçük ve sonlu durum uzaylarında kesin optimal politika bulur. Büyük veya sürekli uzaylarda Q-learning, SARSA ve Proximal Policy Optimization (PPO) gibi model-free pekiştirmeli öğrenme algoritmaları yaklaşık çözüm üretir.

Uygulama Alanları

Oyun Oynama

AlphaGo ve AlphaZero, Go ve satranç için MDP tabanlı Monte Carlo Tree Search ve Deep RL kullanır.

Robotik

Robot yürüyüş kontrolü, manipülatör planlaması ve navigasyon MDP çerçevesinde formüle edilir.

Otonom Araçlar

Yol planlama, hız kontrolü ve kavşak kararları MDP modeli üzerine inşa edilir.

Sağlık

İlaç dozlama optimizasyonu ve tedavi protokolü seçimi MDP ile modellenir.

🎮 MDP Formülasyonu Adımları

  • check_circle Durum uzayını (S) tanımlayın: ajanın çevreyi tam olarak gözlemleyebildiği tüm durumlar
  • check_circle Eylem uzayını (A) belirleyin: her durumda ajanın seçebileceği ayrık veya sürekli eylemler
  • check_circle Geçiş fonksiyonunu (T) modelleyin: P(s'|s,a) olasılık dağılımı deterministik veya stokastik olabilir
  • check_circle Ödül fonksiyonunu (R) tasarlayın: anında geri bildirim sinyali davranışı şekillendirir
  • check_circle İskonto faktörünü (γ) seçin: 0'a yakın anlık ödüle, 1'e yakın uzun vadeli kazanca odaklanır

Sık Sorulan Sorular

  • check_circle MDP ile pekiştirmeli öğrenme arasındaki ilişki nedir? MDP matematiksel çerçeveyi tanımlar; pekiştirmeli öğrenme bu çerçevede optimal politikayı öğrenen algoritmalar bütünüdür.
  • check_circle Markov özelliği neden önemlidir? Gelecek durum geçmişe değil yalnızca mevcut duruma bağlı olduğundan hesaplama dramatik biçimde basitleşir.
  • check_circle POMDP, MDP'den nasıl farklıdır? POMDP'de ajan çevrenin tam durumunu değil yalnızca gürültülü gözlemleri bilir.
  • check_circle İndirim faktörü gamma ne anlama gelir? Gamma=1 uzun vadeli ödülü tam ağırlıkla hesaba katarken, gamma=0 yalnızca anlık ödüle odaklanır.
  • check_circle Q-learning MDP'yi nasıl kullanır? Q-learning, MDP'nin ödül ve geçiş yapısını deneme-yanılmayla öğrenerek Q(s,a) değer tablosunu oluşturur.