tag RNN

GRU (Gated Recurrent Unit) (GRU (Kapılı Tekrarlayan Birim))

Bu sayfada RNN (GRU (Gated Recurrent Unit) (GRU (Kapılı Tekrarlayan Birim))) etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.

GRU (Gated Recurrent Unit — Kapılı Tekrarlayan Birim), 2014 yılında Kyunghyun Cho ve ekibi tarafından önerilen, klasik Tekrarlayan Sinir Ağı (RNN) mimarisinin uzun vadeli bağımlılıkları öğrenmek için geliştirilmiş bir türevidir. Standart RNN'lerin temel sorunu olan kaybolan gradyan problemi (vanishing gradient), uzun dizilerde modelin erken adımlardaki bilgileri "unutmasına" yol açar. GRU bu sorunu, hangi bilgilerin saklanacağını ve hangilerinin atılacağını kontrol eden kapı (gate) mekanizmaları ile çözer. GRU, LSTM (Long Short-Term Memory) ile karşılaştırıldığında daha sade bir mimariye sahiptir. LSTM'de üç ayrı kapı (input, forget, output) ve ayrı bir hücre durumu (cell state) bulunurken, GRU yalnızca iki kapı kullanır: Güncelleme Kapısı (Update Gate) ve Sıfırlama Kapısı (Reset Gate). Bu sadeleştirme eğitim süresini ve bellek kullanımını önemli ölçüde azaltırken pek çok görevde LSTM ile kıyaslanabilir başarım elde edilmesini mümkün kılar. Güncelleme Kapısı (Update Gate), bir önceki gizli durumun (hidden state) ne kadarının yeni duruma aktarılacağını belirler. Bu kapı, geçmiş bilgilerin ne ölçüde korunacağını kontrol eder ve uzun vadeli bellek işlevi görür. Sıfırlama Kapısı (Reset Gate) ise geçmiş bağlamın ne kadarının yeni içeriği hesaplamak için kullanılacağını düzenler; geçmiş bilginin önemsiz olduğu durumlarda bu kapı kapatılarak gizli durum temizlenebilir. GRU, doğal dil işleme, konuşma tanıma, zaman serisi tahmini ve makine çevirisi gibi ardışık veri içeren görevlerde yaygın olarak kullanılır. Özellikle veri miktarının sınırlı olduğu veya hesaplama kapasitesinin kısıtlı olduğu durumlarda LSTM'ye kıyasla tercih edilir. Çift yönlü GRU (Bidirectional GRU) dizi bağlamını hem ileri hem geri yönde yakalayarak duygu analizi ve adlandırılmış varlık tanıma gibi görevlerde üstünlük sağlar. PyTorch'ta torch.nn.GRU, TensorFlow/Keras'ta ise tf.keras.layers.GRU sınıfıyla tek satır kodla kullanıma hazırdır. Hibrit Transformer-GRU mimarileri de araştırma literatüründe giderek daha fazla yer bulmaktadır.

memory

GRU (Gated Recurrent Unit) (GRU (Kapılı Tekrarlayan Birim))

GRU (Gated Recurrent Unit — Kapılı Tekrarlayan Birim), 2014 yılında Kyunghyun Cho ve ekibi tarafından önerilen, klasik Tekrarlayan Sinir Ağı (RNN) mimarisinin uzun vadeli bağımlılıkları öğrenmek için geliştirilmiş bir türevidir. Standart RNN'lerin temel sorunu olan kaybolan gradyan problemi (vanishing gradient), uzun dizilerde modelin erken adımlardaki bilgileri "unutmasına" yol açar. GRU bu sorunu, hangi bilgilerin saklanacağını ve hangilerinin atılacağını kontrol eden kapı (gate) mekanizmaları ile çözer. GRU, LSTM (Long Short-Term Memory) ile karşılaştırıldığında daha sade bir mimariye sahiptir. LSTM'de üç ayrı kapı (input, forget, output) ve ayrı bir hücre durumu (cell state) bulunurken, GRU yalnızca iki kapı kullanır: Güncelleme Kapısı (Update Gate) ve Sıfırlama Kapısı (Reset Gate). Bu sadeleştirme eğitim süresini ve bellek kullanımını önemli ölçüde azaltırken pek çok görevde LSTM ile kıyaslanabilir başarım elde edilmesini mümkün kılar. Güncelleme Kapısı (Update Gate), bir önceki gizli durumun (hidden state) ne kadarının yeni duruma aktarılacağını belirler. Bu kapı, geçmiş bilgilerin ne ölçüde korunacağını kontrol eder ve uzun vadeli bellek işlevi görür. Sıfırlama Kapısı (Reset Gate) ise geçmiş bağlamın ne kadarının yeni içeriği hesaplamak için kullanılacağını düzenler; geçmiş bilginin önemsiz olduğu durumlarda bu kapı kapatılarak gizli durum temizlenebilir. GRU, doğal dil işleme, konuşma tanıma, zaman serisi tahmini ve makine çevirisi gibi ardışık veri içeren görevlerde yaygın olarak kullanılır. Özellikle veri miktarının sınırlı olduğu veya hesaplama kapasitesinin kısıtlı olduğu durumlarda LSTM'ye kıyasla tercih edilir. Çift yönlü GRU (Bidirectional GRU) dizi bağlamını hem ileri hem geri yönde yakalayarak duygu analizi ve adlandırılmış varlık tanıma gibi görevlerde üstünlük sağlar. PyTorch'ta torch.nn.GRU, TensorFlow/Keras'ta ise tf.keras.layers.GRU sınıfıyla tek satır kodla kullanıma hazırdır. Hibrit Transformer-GRU mimarileri de araştırma literatüründe giderek daha fazla yer bulmaktadır.

arrow_forward
code_blocks

Liquid Neural Network (Sıvı Sinir Ağları)

Liquid Neural Network (Sıvı Sinir Ağı), MIT CSAIL'den Ramin Hasani ve Mathias Lechner liderliğindeki ekibin 2020 yılında yayımladığı, zamanla değişen dinamik ağırlıklarla çalışan bir sinir ağı mimarisidir. "Sıvı" metaforu, ağırlıkların eğitim tamamlandığında dondurulması yerine her yeni girdi ile birlikte akışkan biçimde uyum sağlamasına gönderme yapar; bu durum modeli, özellikle zaman boyutu kritik olan görevler için doğası gereği elverişli kılar. Mimarinin çıkış noktası, yalnızca 302 nörona ve yaklaşık 7.000 sinapsa sahip C. elegans adlı nematod solucanının sinir sistemidir. Bu minimalist yapı; koku takibi, ışık hassasiyeti ve karmaşık sensorimotör davranışlar gibi işlevleri başarıyla yönetebilmektedir. MIT ekibi bu organizmanın nöral devrelerini matematiksel olarak modelleyerek Liquid Time-Constant (LTC) adı verilen temel yapı taşını geliştirdi. Teknik açıdan LTC hücresi, zaman sabitinin (τ) girdiye bağlı olarak değiştiği sürekli zamanlı diferansiyel denklem üzerine kurulur: dx/dt = -x/τ(x,I) + f(x,I). Bu denklem her zaman adımında Euler veya Runge-Kutta gibi ODE çözücüleriyle nümerik olarak ilerletilir. Klasik LSTM veya GRU ağlarının aksine, her girdi hücrenin iç dinamiğini geçici olarak etkiler; bu nedenle ağ statik değil, sürekli değişen bir temsil yapısı sunar. Pratik açıdan mimari, otonom araç sterzo kontrolünde standart LSTM'den %26 daha iyi genelleme sağladığı gösterilmiştir. Daha az parametreyle aynı temsil kapasitesine ulaşılması, düşük kaynaklı kenar cihazlarda (MCU, IoT) gerçek zamanlı çıkarım için önemli bir avantaj yaratır. Gürültülü veya eksik veri koşullarında sergilediği gürbüzlük, endüstriyel sensör izleme ve tıbbi sinyal analizi (EEG, EKG) gibi kritik alanlarda tercih nedeni olmaktadır. Eğitim sürecindeki temel zorluk, ODE çözücü adımlarının paralel GPU hesaplamasını güçleştirmesidir. Bu sınırlamayı aşmak için 2022'de Closed-Form Continuous-Time (CfC) mimarisi tanıtıldı; ODE yerine kapalı analitik form kullanarak eğitim süresini belirgin biçimde kısalttı. Ekibin 2023'te kurduğu Liquid AI şirketi bu temeli endüstriyel ölçeğe taşıyan modeller geliştirmektedir.

arrow_forward
sd_storage

LSTM (Long Short-Term Memory) (Uzun Kısa Vadeli Hafıza)

LSTM (Long Short-Term Memory — Uzun Kısa Vadeli Hafıza), standart tekrarlayan sinir ağlarının (RNN) uzun vadeli bağımlılıkları öğrenememesi sorununu çözmek amacıyla 1997 yılında Sepp Hochreiter ve Jürgen Schmidhuber tarafından önerilen özel bir derin öğrenme mimarisidir. Vanilla RNN'ler, zaman içinde geriye doğru yayılan gradyanların katmanlar boyunca küçülerek sıfıra yaklaşmasıyla ortaya çıkan kaybolan gradyan probleminden muzdaripti; bu durum modelin uzun metin dizileri veya ses verilerindeki uzak bağımlılıkları öğrenmesini imkânsız kılıyordu. LSTM bu sorunu üç kapı mekanizmasıyla çözer. Unutma kapısı (forget gate), hücre durumundan hangi bilgilerin atılacağına karar verir; sigmoid aktivasyon fonksiyonu 0 ile 1 arasında bir değer üretir ve buna göre geçmiş bilgi kısmen veya tamamen silinir. Giriş kapısı (input gate), yeni bilgilerin hücre durumuna ne ölçüde ekleneceğini denetler; sigmoid çıktısı ile tanh aktivasyonundan geçirilmiş aday değerlerin çarpımıyla güncelleme gerçekleşir. Çıkış kapısı (output gate) ise hücre durumunun hangi kısmının bu adımın gizli durumu olarak dışarıya aktarılacağını belirler. Bu mimari, özellikle dizi-dizi (seq2seq) görevlerinde 2010'ların başından ortasına kadar baskın model olmuştur. Makine çevirisi, konuşma tanıma, el yazısı tanıma, zaman serisi tahmini ve metin üretimi alanlarında LSTM tabanlı modeller uzun yıllar boyunca en iyi sonuçları üretmiştir. Google Translate, 2016 yılında kural tabanlı sistemden LSTM tabanlı sinir ağı çevirisine geçerek çeviri kalitesinde büyük bir sıçrama kaydetmiştir. 2017'den itibaren Transformer mimarisinin yükselişiyle LSTM'nin hâkimiyeti azalmıştır. Transformer'lar dikkat mekanizması (attention) aracılığıyla paralel hesaplamaya olanak tanıyarak eğitim hızını dramatik biçimde artırır; bu avantaj GPT ve BERT gibi büyük dil modellerinin temelini oluşturur. Bununla birlikte LSTM, sinyal işleme, finans zaman serileri ve kaynak kısıtlı ortamlar gibi alanlarda hâlâ tercih edilen bir mimari olmaya devam etmektedir.

arrow_forward