tag Dizi Modelleme
LSTM (Long Short-Term Memory) (Uzun Kısa Vadeli Hafıza)
Bu sayfada Dizi Modelleme (LSTM (Long Short-Term Memory) (Uzun Kısa Vadeli Hafıza)) etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.
LSTM (Long Short-Term Memory — Uzun Kısa Vadeli Hafıza), standart tekrarlayan sinir ağlarının (RNN) uzun vadeli bağımlılıkları öğrenememesi sorununu çözmek amacıyla 1997 yılında Sepp Hochreiter ve Jürgen Schmidhuber tarafından önerilen özel bir derin öğrenme mimarisidir. Vanilla RNN'ler, zaman içinde geriye doğru yayılan gradyanların katmanlar boyunca küçülerek sıfıra yaklaşmasıyla ortaya çıkan kaybolan gradyan probleminden muzdaripti; bu durum modelin uzun metin dizileri veya ses verilerindeki uzak bağımlılıkları öğrenmesini imkânsız kılıyordu. LSTM bu sorunu üç kapı mekanizmasıyla çözer. Unutma kapısı (forget gate), hücre durumundan hangi bilgilerin atılacağına karar verir; sigmoid aktivasyon fonksiyonu 0 ile 1 arasında bir değer üretir ve buna göre geçmiş bilgi kısmen veya tamamen silinir. Giriş kapısı (input gate), yeni bilgilerin hücre durumuna ne ölçüde ekleneceğini denetler; sigmoid çıktısı ile tanh aktivasyonundan geçirilmiş aday değerlerin çarpımıyla güncelleme gerçekleşir. Çıkış kapısı (output gate) ise hücre durumunun hangi kısmının bu adımın gizli durumu olarak dışarıya aktarılacağını belirler. Bu mimari, özellikle dizi-dizi (seq2seq) görevlerinde 2010'ların başından ortasına kadar baskın model olmuştur. Makine çevirisi, konuşma tanıma, el yazısı tanıma, zaman serisi tahmini ve metin üretimi alanlarında LSTM tabanlı modeller uzun yıllar boyunca en iyi sonuçları üretmiştir. Google Translate, 2016 yılında kural tabanlı sistemden LSTM tabanlı sinir ağı çevirisine geçerek çeviri kalitesinde büyük bir sıçrama kaydetmiştir. 2017'den itibaren Transformer mimarisinin yükselişiyle LSTM'nin hâkimiyeti azalmıştır. Transformer'lar dikkat mekanizması (attention) aracılığıyla paralel hesaplamaya olanak tanıyarak eğitim hızını dramatik biçimde artırır; bu avantaj GPT ve BERT gibi büyük dil modellerinin temelini oluşturur. Bununla birlikte LSTM, sinyal işleme, finans zaman serileri ve kaynak kısıtlı ortamlar gibi alanlarda hâlâ tercih edilen bir mimari olmaya devam etmektedir.
LSTM (Long Short-Term Memory) (Uzun Kısa Vadeli Hafıza)
LSTM (Long Short-Term Memory — Uzun Kısa Vadeli Hafıza), standart tekrarlayan sinir ağlarının (RNN) uzun vadeli bağımlılıkları öğrenememesi sorununu çözmek amacıyla 1997 yılında Sepp Hochreiter ve Jürgen Schmidhuber tarafından önerilen özel bir derin öğrenme mimarisidir. Vanilla RNN'ler, zaman içinde geriye doğru yayılan gradyanların katmanlar boyunca küçülerek sıfıra yaklaşmasıyla ortaya çıkan kaybolan gradyan probleminden muzdaripti; bu durum modelin uzun metin dizileri veya ses verilerindeki uzak bağımlılıkları öğrenmesini imkânsız kılıyordu. LSTM bu sorunu üç kapı mekanizmasıyla çözer. Unutma kapısı (forget gate), hücre durumundan hangi bilgilerin atılacağına karar verir; sigmoid aktivasyon fonksiyonu 0 ile 1 arasında bir değer üretir ve buna göre geçmiş bilgi kısmen veya tamamen silinir. Giriş kapısı (input gate), yeni bilgilerin hücre durumuna ne ölçüde ekleneceğini denetler; sigmoid çıktısı ile tanh aktivasyonundan geçirilmiş aday değerlerin çarpımıyla güncelleme gerçekleşir. Çıkış kapısı (output gate) ise hücre durumunun hangi kısmının bu adımın gizli durumu olarak dışarıya aktarılacağını belirler. Bu mimari, özellikle dizi-dizi (seq2seq) görevlerinde 2010'ların başından ortasına kadar baskın model olmuştur. Makine çevirisi, konuşma tanıma, el yazısı tanıma, zaman serisi tahmini ve metin üretimi alanlarında LSTM tabanlı modeller uzun yıllar boyunca en iyi sonuçları üretmiştir. Google Translate, 2016 yılında kural tabanlı sistemden LSTM tabanlı sinir ağı çevirisine geçerek çeviri kalitesinde büyük bir sıçrama kaydetmiştir. 2017'den itibaren Transformer mimarisinin yükselişiyle LSTM'nin hâkimiyeti azalmıştır. Transformer'lar dikkat mekanizması (attention) aracılığıyla paralel hesaplamaya olanak tanıyarak eğitim hızını dramatik biçimde artırır; bu avantaj GPT ve BERT gibi büyük dil modellerinin temelini oluşturur. Bununla birlikte LSTM, sinyal işleme, finans zaman serileri ve kaynak kısıtlı ortamlar gibi alanlarda hâlâ tercih edilen bir mimari olmaya devam etmektedir.
CTC (Connectionist Temporal Classification) (Bağlantıcı Zamansal Sınıflandırma)
CTC (Connectionist Temporal Classification — Bağlantıcı Zamansal Sınıflandırma), girdi dizisini çıktı dizisiyle zaman hizalaması yapmadan doğrudan eğitmeyi sağlayan bir kayıp fonksiyonu ve çıkarım algoritmasıdır. Graves ve arkadaşları tarafından 2006'da önerilen bu yaklaşım, özellikle otomatik konuşma tanıma (ASR) ve el yazısı tanımada devrim yaratmıştır. Geleneksel dizi modelleri, giriş çerçeveleri ile çıktı sembolleri arasında önceden tanımlı hizalama etiketlerine ihtiyaç duyar. Bunu sağlamak emek yoğundur ve uzman işaretleme gerektirir. CTC bu kısıtı ortadan kaldırır: model, hangi girdi çerçevesinin hangi çıktı sembolüne karşılık geldiğini öğrenmek yerine, tüm olası hizalamalar üzerinden toplamı hesaplayarak optimize edilir. Bunun için çıktı alfabesine özel bir 'boş karakter' (blank) eklenir; bu karakter tekrarlı sembolleri ve dolgu çerçevelerini temsil eder. Eğitim sırasında ileri-geri algoritması (forward-backward algorithm) kullanılarak bütün geçerli hizalamaların olasılıkları verimli biçimde hesaplanır ve hedef dizinin toplam olasılığı maksimize edilir. Çıkarım aşamasında açgözlü kod çözme (greedy decoding) ya da kiriş arama (beam search) kullanılarak en olası çıktı dizisi elde edilir; tekrarlı karakterler ve blank semboller kaldırılarak nihai metin üretilir. CTC, derin öğrenmenin konuşma tanımada yaygınlaşmasında kritik rol oynamıştır. wav2vec 2.0, Conformer-CTC ve bazı Whisper varyantları gibi modern modeller CTC kaybını büyük ölçekli ön eğitimle birleştirmektedir. El yazısı ve optik karakter tanıma (OCR) sistemleri de CTC'yi satır düzeyinde metin hizalaması için kullanmaktadır. Attention tabanlı kodlayıcı-çözücü mimarilerin yaygınlaşmasıyla birlikte CTC çoğunlukla hibrit sistemlerde yardımcı kayıp (auxiliary CTC loss) olarak kullanılmakta, hem eğitim hızlanmakta hem de monotonik hizalama zorlanmaktadır.
Hidden Markov Model (Gizli Markov Modeli)
Hidden Markov Model (Gizli Markov Modeli — HMM), gözlemlenemeyen (gizli) durumlar arasındaki olasılıksal geçişleri ve bu durumların ürettiği gözlemleri modelleyen bir olasılıksal grafik modelidir. "Markov" özelliği, bir sonraki durumun yalnızca mevcut duruma bağlı olduğunu; geçmiş tüm durumlardan bağımsız olduğunu ifade eder. "Gizli" sözcüğü ise gerçek sistem durumlarının doğrudan gözlemlenemeyip yalnızca bu durumların ürettiği semboller ya da sinyaller aracılığıyla çıkarsanabileceğini belirtir. Matematiksel olarak HMM beş bileşenden oluşur: gizli durum kümesi S, gözlem sembol kümesi O, durum geçiş olasılıkları matrisi A (A[i][j] = i durumundan j durumuna geçiş olasılığı), yayılım (emission) olasılıkları matrisi B (B[j][k] = j durumundayken k sembolünü yayma olasılığı) ve başlangıç durum dağılımı π. HMM'e yönelik üç temel hesaplama problemi vardır. İlki değerlendirme (evaluation): verili gözlem dizisi için modelin bu diziyi üretme olasılığını hesaplamak; İleri Algoritma (Forward Algorithm) bu problemin verimli çözümüdür. İkincisi çözümleme (decoding): verili gözlem dizisine en olası gizli durum dizisini bulmak; Viterbi Algoritması dinamik programlama ile bu görevi O(N²T) süre karmaşıklığıyla çözer. Üçüncüsü öğrenme (learning): gözlem verilerinden A, B ve π parametrelerini tahmin etmek; Baum-Welch Algoritması, Beklenti-Maksimizasyon (EM) çerçevesinde bu görevi yerine getirir. Tarihsel olarak HMM, 1970'lerde otomatik konuşma tanıma (ASR) sistemlerinin temel taşı oldu: akustik model olarak her fonem bir HMM durumuna karşılık gelirken Viterbi algoritması en olası fonem dizisini çözümler. Ayrıca POS (part-of-speech) etiketleme, biyoinformatik (gen dizisi analizi), jest ve el yazısı tanıma ile finansal zaman serisi modellemesinde yaygın biçimde kullanılmıştır. Derin öğrenme çağında RNN ve Transformer mimarileri büyük ölçüde HMM'nin yerini almıştır; ancak HMM yorumlanabilirliği, gizli durum ayrımı ve küçük veri senaryolarındaki avantajlarını korumaktadır. Modern ASR sistemlerinde CTC-HMM hibrit mimarileri hâlâ üretimde kullanılmakta; kaldi ve ESPnet gibi araç setleri bu yaklaşımı desteklemektedir. Türkçe konuşma tanıma araştırmalarında HMM tabanlı akustik modeller akademik çalışmalarda referans noktası olma özelliğini sürdürmektedir.
Mamba (Mamba)
Mamba, 2023 yılında Carnegie Mellon Üniversitesi'nden Albert Gu ve Princeton Üniversitesi'nden Tri Dao tarafından yayımlanan 'Mamba: Linear-Time Sequence Modeling with Selective State Spaces' makalesiyle tanıtılan, Transformer mimarisine güçlü bir alternatif sunan dizi modelleme yaklaşımıdır. Geleneksel Transformer'lar, dizi içindeki her iki token çifti arasında dikkat (attention) hesaplaması yaparak O(n²) zaman ve bellek karmaşıklığı üretir. Bu, dizi uzunluğu arttıkça bellek gereksinimini katlanarak büyütür ve çok uzun bağlamları (örneğin 100.000 token) pratik olarak işlemeyi güçleştirir. Mamba bu sorunu temel düzeyde farklı bir yaklaşımla çözer: giriş dizisini gizli bir durum vektörü (hidden state) üzerinden ardışık olarak işleyen Seçici Durum Uzayı Modellerini (Selective State Space Models — S4/SSM) benimseyerek O(n) doğrusal karmaşıklıkla çalışır. Mamba'nın önceki durum uzayı modellerinden temel farkı 'seçicilik' (selectivity) mekanizmasıdır. Klasik SSM'lerde A, B, C geçiş matrisleri sabit parametrelerdir ve girişten bağımsız aynı dönüşümü uygularlar. Mamba'da ise bu parametreler her giriş tokenine göre dinamik biçimde hesaplanır: model, o andaki token değerine bakarak hangi bilginin gizli duruma yazılacağına, hangisinin unutulacağına her adımda ayrı ayrı karar verebilir. Bu esneklik sayesinde model hem kısa bağımlılıkları hem de çok uzak konumlardaki uzun bağımlılıkları (long-range dependencies) başarıyla yakalayabilmektedir. Donanım verimliliği açısından Mamba özgün bir çözüm sunar. Eğitim sırasında paralel tarama (parallel scan) algoritması kullanarak GPU'ların yoğun paralel hesaplama kapasitesinden yararlanır. Çıkarım (inference) aşamasında ise gizli durum boyutu sabit kaldığından bellek gereksinimi dizinin uzunluğuyla artmaz — bu özellik özellikle çok uzun bağlamlarda (100K+ token) belirleyici bir avantaj sağlar. Mamba mimarisi dil modellemesinden biyoinformatiğe, ses sinyali işlemeden zaman serisi tahminlemeye kadar geniş bir yelpazede uygulanmaktadır. AI21 Labs'ın Jamba modeli, Mamba ve Transformer katmanlarını hibrit biçimde birleştirerek her iki yaklaşımın güçlü yönlerinden yararlanan önemli bir örnek oluşturmuştur. Araştırmalar, benzer parametre sayısına sahip Transformer modelleriyle kıyaslandığında Mamba'nın özellikle uzun dizi senaryolarında verimlilik avantajının belirginleştiğini ve bazı görevlerde rekabetçi kalite sonuçları ürettiğini ortaya koymaktadır.