tag DQN
Q-Learning (Q-Öğrenme)
Bu sayfada DQN (Q-Learning (Q-Öğrenme)) etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
Q-Learning, pekiştirmeli öğrenmenin (reinforcement learning) model-bağımsız ve off-policy bir alt dalıdır. 1989 yılında Christopher Watkins tarafından geliştirilen bu algoritma, bir ajanın çevresiyle deneme-yanılma yoluyla etkileşime girerek en yüksek birikimli ödülü sağlayacak politikayı öğrenmesini hedefler. Algoritmanın temel bileşeni Q-değer fonksiyonu Q(s, a)'dır. Burada s bir durumu (state), a ise bir eylemi (action) temsil eder. Q(s, a), ajan s durumundayken a eylemini seçip ardından optimal stratejiyi izlediğinde elde edeceği beklenen toplam gelecek ödülü ifade eder. Q harfi kalite kelimesinden gelir ve belirli bir durumda belirli bir eylemin ne kadar değerli olduğunu ölçer. Öğrenme süreci bir Q-tablosu üzerinden yürür. Başlangıçta sıfırlarla başlatılan bu tablo, ajan her eylemden sonra alınan r ödülü ve gözlemlenen yeni s' durumuna göre Bellman denklemiyle güncellenir: Q(s, a) ← Q(s, a) + α · [r + γ · max_a' Q(s', a') − Q(s, a)]. Bu formülde α öğrenme oranını, γ indirim faktörünü gösterir; indirim faktörü yakın ödüllerin mi yoksa uzak ödüllerin mi öne çıkarılacağını belirler. Ajan, yeni durumları keşfetmek (exploration) ile bilinen en iyi eylemi seçmek (exploitation) arasındaki dengeyi ε-greedy stratejisiyle yönetir. Durum uzayı büyüdükçe Q-tablosu pratik olmaktan çıkar. Bu sorunu aşmak için DeepMind 2015'te Derin Q-Ağı'nı (Deep Q-Network, DQN) tanıttı. DQN, Q-tablosunu derin bir sinir ağıyla değiştirir ve deneyim tekrarı (experience replay) ile hedef ağ (target network) gibi mekanizmalar aracılığıyla öğrenmeyi kararlı kılar. DQN, yalnızca ham piksel verisiyle 49 Atari oyununda insan düzeyinde performans göstererek derin pekiştirmeli öğrenme alanını doğurdu. Q-Learning bugün enerji sistemleri optimizasyonu, otonom araç kontrolü, robotik görev planlama, kenar-bulut bilişimde gecikme yönetimi ve ilaç keşfinde aktif biçimde kullanılmaktadır.