MDP Nedir?
Markov Karar Süreci (MDP), bir ajanın stokastik bir çevreyle etkileşimini matematiksel olarak modelleyen karar teorisi çerçevesidir. Durum (S), eylem (A), geçiş olasılıkları (P) ve ödül (R) bileşenleriyle tanımlanır; pekiştirmeli öğrenmenin temel matematiksel altyapısını oluşturur.
Temel Bileşenler
Durum Uzayı (S)
Ajanın içinde bulunabileceği tüm olası durumların kümesi; sonlu veya sürekli olabilir.
Eylem Uzayı (A)
Her durumda ajanın seçebileceği eylemler; deterministik veya stokastik politikayla seçilir.
Geçiş Fonksiyonu P
P(s'|s,a): s durumunda a eylemi gerçekleştirildiğinde s' durumuna geçiş olasılığı.
Ödül Fonksiyonu R
R(s,a): s durumunda a eylemi sonrası alınan anlık sayısal ödül; maximize edilmek istenir.
Çözüm Algoritmaları
Bellman optimality denklemleri MDP'nin matematiksel çözümünü tanımlar. Değer iterasyonu ve politika iterasyonu küçük ve sonlu durum uzaylarında kesin optimal politika bulur. Büyük veya sürekli uzaylarda Q-learning, SARSA ve Proximal Policy Optimization (PPO) gibi model-free pekiştirmeli öğrenme algoritmaları yaklaşık çözüm üretir.
Uygulama Alanları
Oyun Oynama
AlphaGo ve AlphaZero, Go ve satranç için MDP tabanlı Monte Carlo Tree Search ve Deep RL kullanır.
Robotik
Robot yürüyüş kontrolü, manipülatör planlaması ve navigasyon MDP çerçevesinde formüle edilir.
Otonom Araçlar
Yol planlama, hız kontrolü ve kavşak kararları MDP modeli üzerine inşa edilir.
Sağlık
İlaç dozlama optimizasyonu ve tedavi protokolü seçimi MDP ile modellenir.
🎮 MDP Formülasyonu Adımları
- check_circle Durum uzayını (S) tanımlayın: ajanın çevreyi tam olarak gözlemleyebildiği tüm durumlar
- check_circle Eylem uzayını (A) belirleyin: her durumda ajanın seçebileceği ayrık veya sürekli eylemler
- check_circle Geçiş fonksiyonunu (T) modelleyin: P(s'|s,a) olasılık dağılımı deterministik veya stokastik olabilir
- check_circle Ödül fonksiyonunu (R) tasarlayın: anında geri bildirim sinyali davranışı şekillendirir
- check_circle İskonto faktörünü (γ) seçin: 0'a yakın anlık ödüle, 1'e yakın uzun vadeli kazanca odaklanır
Sık Sorulan Sorular
- check_circle MDP ile pekiştirmeli öğrenme arasındaki ilişki nedir? MDP matematiksel çerçeveyi tanımlar; pekiştirmeli öğrenme bu çerçevede optimal politikayı öğrenen algoritmalar bütünüdür.
- check_circle Markov özelliği neden önemlidir? Gelecek durum geçmişe değil yalnızca mevcut duruma bağlı olduğundan hesaplama dramatik biçimde basitleşir.
- check_circle POMDP, MDP'den nasıl farklıdır? POMDP'de ajan çevrenin tam durumunu değil yalnızca gürültülü gözlemleri bilir.
- check_circle İndirim faktörü gamma ne anlama gelir? Gamma=1 uzun vadeli ödülü tam ağırlıkla hesaba katarken, gamma=0 yalnızca anlık ödüle odaklanır.
- check_circle Q-learning MDP'yi nasıl kullanır? Q-learning, MDP'nin ödül ve geçiş yapısını deneme-yanılmayla öğrenerek Q(s,a) değer tablosunu oluşturur.