tag olasılıksal-model

Expectation-Maximization Algorithm (Expectation-Maximization (EM) Algoritması)

Bu sayfada olasılıksal-model (Expectation-Maximization Algorithm (Expectation-Maximization (EM) Algoritması)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.

Expectation-Maximization (EM) algoritması, gizli (latent) değişkenler içeren istatistiksel modellerde maksimum olabilirlik (MLE) veya maksimum sonsal (MAP) parametre tahminleri hesaplamak için kullanılan yinelemeli bir optimizasyon yöntemidir. Arthur Dempster, Nan Laird ve Donald Rubin'in 1977'de Journal of the Royal Statistical Society'de yayımladığı seminal çalışmayla sistematik olarak formüle edilmiştir. Algoritma iki temel adımdan oluşur: E-adımında (Expectation — Beklenti), mevcut parametre tahminleri kullanılarak gizli değişkenlerin koşullu beklentileri hesaplanır; Q fonksiyonu olarak adlandırılan bu beklenti, log-olabilirliğin alt sınırını oluşturur. M-adımında (Maximization — Maksimizasyon) ise Q fonksiyonunu maksimize eden yeni parametre tahminleri bulunur. Bu iki adım yakınsayana kadar tekrarlanır ve her yineleme modeli veriye biraz daha iyi uyacak şekilde günceller. EM'in en kritik matematiksel özelliği, her iterasyonda gözlemlenen verinin log-olabilirliğinin azalmayacağının Jensen eşitsizliğiyle garanti edilmesidir. Bu özellik algoritmayı istikrarlı kılar ve kesinlikle bir sabit noktaya ya da yerel optimuma yakınsayacağını güvence altına alır; ancak başlangıç noktasına duyarlılık nedeniyle bu noktanın global optimum olması garanti değildir. Bu sorunu hafifletmek için çoklu rastlantısal başlatma (random restarts) veya k-means++ başlatma stratejisi yaygın olarak kullanılır. Makine öğrenimi tarihindeki en etkili algoritmalardan biri olan EM, Gaussian Karışım Modelleri (GMM), Hidden Markov Models (HMM) için Baum-Welch algoritması, Gizli Dirichlet Tahsisi (LDA) gibi konu modelleri ve eksik veri senaryolarında parametre tahmininde yaygın biçimde kullanılmaktadır. K-means kümeleme algoritması, EM'in sert (hard) atama kullanan özel bir durumu olarak formüle edilebilir; GMM ise bu çerçevenin daha esnek ve olasılıksal genellemesidir. Derin öğrenme çağında da EM canlılığını korumaktadır. Yarı gözetimli öğrenmede, Varyasyonel Otokodlayıcıların (VAE) eğitiminde ve Beklenti Yayılımı (Expectation Propagation) gibi Bayesçi çıkarım yöntemlerinde EM'in olasılıksal çerçevesi temel taş olmaya devam etmektedir.

code_blocks

Expectation-Maximization Algorithm (Expectation-Maximization (EM) Algoritması)

Expectation-Maximization (EM) algoritması, gizli (latent) değişkenler içeren istatistiksel modellerde maksimum olabilirlik (MLE) veya maksimum sonsal (MAP) parametre tahminleri hesaplamak için kullanılan yinelemeli bir optimizasyon yöntemidir. Arthur Dempster, Nan Laird ve Donald Rubin'in 1977'de Journal of the Royal Statistical Society'de yayımladığı seminal çalışmayla sistematik olarak formüle edilmiştir. Algoritma iki temel adımdan oluşur: E-adımında (Expectation — Beklenti), mevcut parametre tahminleri kullanılarak gizli değişkenlerin koşullu beklentileri hesaplanır; Q fonksiyonu olarak adlandırılan bu beklenti, log-olabilirliğin alt sınırını oluşturur. M-adımında (Maximization — Maksimizasyon) ise Q fonksiyonunu maksimize eden yeni parametre tahminleri bulunur. Bu iki adım yakınsayana kadar tekrarlanır ve her yineleme modeli veriye biraz daha iyi uyacak şekilde günceller. EM'in en kritik matematiksel özelliği, her iterasyonda gözlemlenen verinin log-olabilirliğinin azalmayacağının Jensen eşitsizliğiyle garanti edilmesidir. Bu özellik algoritmayı istikrarlı kılar ve kesinlikle bir sabit noktaya ya da yerel optimuma yakınsayacağını güvence altına alır; ancak başlangıç noktasına duyarlılık nedeniyle bu noktanın global optimum olması garanti değildir. Bu sorunu hafifletmek için çoklu rastlantısal başlatma (random restarts) veya k-means++ başlatma stratejisi yaygın olarak kullanılır. Makine öğrenimi tarihindeki en etkili algoritmalardan biri olan EM, Gaussian Karışım Modelleri (GMM), Hidden Markov Models (HMM) için Baum-Welch algoritması, Gizli Dirichlet Tahsisi (LDA) gibi konu modelleri ve eksik veri senaryolarında parametre tahmininde yaygın biçimde kullanılmaktadır. K-means kümeleme algoritması, EM'in sert (hard) atama kullanan özel bir durumu olarak formüle edilebilir; GMM ise bu çerçevenin daha esnek ve olasılıksal genellemesidir. Derin öğrenme çağında da EM canlılığını korumaktadır. Yarı gözetimli öğrenmede, Varyasyonel Otokodlayıcıların (VAE) eğitiminde ve Beklenti Yayılımı (Expectation Propagation) gibi Bayesçi çıkarım yöntemlerinde EM'in olasılıksal çerçevesi temel taş olmaya devam etmektedir.

arrow_forward
code_blocks

Hidden Markov Model (Gizli Markov Modeli)

Hidden Markov Model (Gizli Markov Modeli — HMM), gözlemlenemeyen (gizli) durumlar arasındaki olasılıksal geçişleri ve bu durumların ürettiği gözlemleri modelleyen bir olasılıksal grafik modelidir. "Markov" özelliği, bir sonraki durumun yalnızca mevcut duruma bağlı olduğunu; geçmiş tüm durumlardan bağımsız olduğunu ifade eder. "Gizli" sözcüğü ise gerçek sistem durumlarının doğrudan gözlemlenemeyip yalnızca bu durumların ürettiği semboller ya da sinyaller aracılığıyla çıkarsanabileceğini belirtir. Matematiksel olarak HMM beş bileşenden oluşur: gizli durum kümesi S, gözlem sembol kümesi O, durum geçiş olasılıkları matrisi A (A[i][j] = i durumundan j durumuna geçiş olasılığı), yayılım (emission) olasılıkları matrisi B (B[j][k] = j durumundayken k sembolünü yayma olasılığı) ve başlangıç durum dağılımı π. HMM'e yönelik üç temel hesaplama problemi vardır. İlki değerlendirme (evaluation): verili gözlem dizisi için modelin bu diziyi üretme olasılığını hesaplamak; İleri Algoritma (Forward Algorithm) bu problemin verimli çözümüdür. İkincisi çözümleme (decoding): verili gözlem dizisine en olası gizli durum dizisini bulmak; Viterbi Algoritması dinamik programlama ile bu görevi O(N²T) süre karmaşıklığıyla çözer. Üçüncüsü öğrenme (learning): gözlem verilerinden A, B ve π parametrelerini tahmin etmek; Baum-Welch Algoritması, Beklenti-Maksimizasyon (EM) çerçevesinde bu görevi yerine getirir. Tarihsel olarak HMM, 1970'lerde otomatik konuşma tanıma (ASR) sistemlerinin temel taşı oldu: akustik model olarak her fonem bir HMM durumuna karşılık gelirken Viterbi algoritması en olası fonem dizisini çözümler. Ayrıca POS (part-of-speech) etiketleme, biyoinformatik (gen dizisi analizi), jest ve el yazısı tanıma ile finansal zaman serisi modellemesinde yaygın biçimde kullanılmıştır. Derin öğrenme çağında RNN ve Transformer mimarileri büyük ölçüde HMM'nin yerini almıştır; ancak HMM yorumlanabilirliği, gizli durum ayrımı ve küçük veri senaryolarındaki avantajlarını korumaktadır. Modern ASR sistemlerinde CTC-HMM hibrit mimarileri hâlâ üretimde kullanılmakta; kaldi ve ESPnet gibi araç setleri bu yaklaşımı desteklemektedir. Türkçe konuşma tanıma araştırmalarında HMM tabanlı akustik modeller akademik çalışmalarda referans noktası olma özelliğini sürdürmektedir.

arrow_forward