tag sinir ağları
Bu sayfada sinir ağları etiketi ile işaretlenmiş 10 yapay zeka kavramını bulabilirsiniz.
Dropout, derin sinir ağı eğitimi sırasında her güncelleme adımında belirli bir olasılıkla (dropout oranı, p) gizli katman nöronlarının çıkışlarını sıfırlayan ve bu şekilde modelin belirli nöronlara bağımlılığını kıran bir düzenlileştirme tekniğidir. 2014 yılında Srivastava ve arkadaşları tarafından önerilen bu yöntem, derin öğrenme tarihinin en etkili yeniliklerinden biri olarak kabul görmektedir. Temel fikir, eğitim sırasında ağı sürekli değişen rastgele alt ağlar üzerinde çalıştırarak her nöronun diğer nöronların varlığına ya da yokluğuna göre hareket etmeyi öğrenmesini önlemektir. Bu mekanizma, ko-adaptasyonu (co-adaptation) kırar ve her nöronu bağımsız olarak yararlı özellikler çıkarmaya zorlar. Ağ böylece tek bir nörona veya nöron grubuna aşırı güvenmek yerine dağıtık temsiller öğrenir. Pratikte dropout oranı p=0.5, tam bağlı katmanlar için standart başlangıç noktası olarak yaygın biçimde kullanılmaktadır. Ancak giriş katmanlarında p=0.1-0.2, konvolüsyonel katmanlarda daha düşük değerler tercih edilir; bu katmanlarda zaten az parametre bulunduğundan çok yüksek dropout aşırı bilgi kaybına yol açabilir. Batch normalization ile birlikte kullanıldığında dikkatli olmak gerekir; ikisi arasındaki etkileşim bazen istenmeyen davranışlara neden olabilmektedir. Test aşamasında dropout tamamen devre dışı bırakılır; tüm nöronlar aktif kalır. Ağırlıklar eğitim sırasında kullanılan seyrelmeyi telafi etmek için (1−p) çarpanıyla ölçeklenir. Modern çerçeveler "inverted dropout" uygular: eğitim sırasında kalan nöronların çıkışları 1/(1−p) ile çarpılır, böylece test aşamasında ekstra işlem gerekmez. PyTorch'ta torch.nn.Dropout(p=0.5) ve Keras'ta layers.Dropout(0.5) ile tek satırda eklenir. Dropout ayrıca Bayesian derin öğrenmeyle de ilişkilendirilmektedir. Test zamanında da dropout açık tutularak birden fazla tahmin yapılırsa (MC Dropout), bu tahminlerin dağılımı modelin belirsizliğine dair istatistiksel bilgi üretir. Özellikle tıbbi teşhis ve otonom araç gibi güvenlik açısından kritik uygulamalarda bu özellik son derece değerlidir. Spatial Dropout ise konvolüsyonel ağlarda tüm özellik haritası kanallarını sıfırlayarak uzamsal bağıntıları daha etkili biçimde kırmaktadır.
Dropout (Düzenlileştirme Tekniği)
Dropout, derin sinir ağı eğitimi sırasında her güncelleme adımında belirli bir olasılıkla (dropout oranı, p) gizli katman nöronlarının çıkışlarını sıfırlayan ve bu şekilde modelin belirli nöronlara bağımlılığını kıran bir düzenlileştirme tekniğidir. 2014 yılında Srivastava ve arkadaşları tarafından önerilen bu yöntem, derin öğrenme tarihinin en etkili yeniliklerinden biri olarak kabul görmektedir. Temel fikir, eğitim sırasında ağı sürekli değişen rastgele alt ağlar üzerinde çalıştırarak her nöronun diğer nöronların varlığına ya da yokluğuna göre hareket etmeyi öğrenmesini önlemektir. Bu mekanizma, ko-adaptasyonu (co-adaptation) kırar ve her nöronu bağımsız olarak yararlı özellikler çıkarmaya zorlar. Ağ böylece tek bir nörona veya nöron grubuna aşırı güvenmek yerine dağıtık temsiller öğrenir. Pratikte dropout oranı p=0.5, tam bağlı katmanlar için standart başlangıç noktası olarak yaygın biçimde kullanılmaktadır. Ancak giriş katmanlarında p=0.1-0.2, konvolüsyonel katmanlarda daha düşük değerler tercih edilir; bu katmanlarda zaten az parametre bulunduğundan çok yüksek dropout aşırı bilgi kaybına yol açabilir. Batch normalization ile birlikte kullanıldığında dikkatli olmak gerekir; ikisi arasındaki etkileşim bazen istenmeyen davranışlara neden olabilmektedir. Test aşamasında dropout tamamen devre dışı bırakılır; tüm nöronlar aktif kalır. Ağırlıklar eğitim sırasında kullanılan seyrelmeyi telafi etmek için (1−p) çarpanıyla ölçeklenir. Modern çerçeveler "inverted dropout" uygular: eğitim sırasında kalan nöronların çıkışları 1/(1−p) ile çarpılır, böylece test aşamasında ekstra işlem gerekmez. PyTorch'ta torch.nn.Dropout(p=0.5) ve Keras'ta layers.Dropout(0.5) ile tek satırda eklenir. Dropout ayrıca Bayesian derin öğrenmeyle de ilişkilendirilmektedir. Test zamanında da dropout açık tutularak birden fazla tahmin yapılırsa (MC Dropout), bu tahminlerin dağılımı modelin belirsizliğine dair istatistiksel bilgi üretir. Özellikle tıbbi teşhis ve otonom araç gibi güvenlik açısından kritik uygulamalarda bu özellik son derece değerlidir. Spatial Dropout ise konvolüsyonel ağlarda tüm özellik haritası kanallarını sıfırlayarak uzamsal bağıntıları daha etkili biçimde kırmaktadır.
Pooling (Havuzlama Katmanı)
Havuzlama (Pooling) katmanı, evrişimli sinir ağlarının (CNN) temel bileşenlerinden biridir; özellik haritalarının uzamsal boyutlarını sistematik biçimde küçülterek en önemli bilgilerin yoğunlaştırılmasını sağlar. Evrişim katmanlarından elde edilen yüksek boyutlu aktivasyon haritaları, belirli bir pencere (kernel) içindeki değerleri tek bir değere özetleyerek daha küçük bir temsile dönüştürülür. En yaygın kullanılan türü maksimum havuzlama (max pooling) dur. Bu yöntemde belirlenen pencere (genellikle 2×2) içindeki en yüksek değer alınır ve özellik haritasının boyutu küçültülür. Max pooling, keskin ve belirgin özellikleri ön plana çıkarır; nesne tanıma ve sınıflandırma görevlerinde uygulamaların yaklaşık yüzde 80-90 ında bu yöntem tercih edilir. Ortalama havuzlama (average pooling) ise penceredeki tüm değerlerin ortalamasını alarak daha yumuşak bir temsil oluşturur. Gürültüye karşı daha dirençli olmakla birlikte bazen belirgin özellikleri zayıflatabilir. Küresel ortalama havuzlama (Global Average Pooling, GAP), tüm özellik haritasını tek bir değere indirgeyen modern bir yaklaşımdır. Tam bağlantılı katmanların yerini alabilmesi, parametre sayısını dramatik biçimde azaltır. VGG mimarisinin 138 milyon parametresi ResNet te 25 milyona inmiş olup bu farkın büyük bölümü GAP kullanımından kaynaklanmaktadır. MobileNet ve EfficientNet gibi hafif mimarilerde GAP artık standart bir seçenek hâline gelmiştir. Havuzlama katmanları öğrenilemeyen işlemlerdir; hiçbir ağırlık içermez. Geri yayılım sırasında max pooling yalnızca maksimum değerin bulunduğu konuma gradyanı iletirken diğer konumlara sıfır aktarır (switch mekanizması). Average pooling ise gradyanı penceredeki tüm konumlara eşit biçimde dağıtır. Havuzlamanın kritik bir katkısı translasyon değişmezliği (translation invariance) dir: bir nesne görüntüde birkaç piksel kaymış olsa bile max pooling, bölgenin en güçlü aktivasyonunu yakaladığından benzer sonuçlar üretebilir. Tarihsel olarak AlexNet (2012) ve VGG (2014) gibi öncü mimariler havuzlamaya yoğun biçimde başvurmuştur. Günümüzde adımlı evrişim (strided convolution) ve dilate evrişim gibi öğrenilebilir alternatifler önem kazanmış; Vision Transformer (ViT) gibi dikkat tabanlı modeller ise uzamsal alt örnekleme için dikkat mekanizmalarını tercih etmiştir. Buna karşın, evrişimli tabanlı ve gömülü sistem uygulamalarında havuzlama vazgeçilmez bir bileşen olmayı sürdürmektedir.
Vanishing Gradient Problem (Kaybolan Gradyan Problemi)
Kaybolan Gradyan Problemi (Vanishing Gradient Problem), derin sinir ağlarında geri yayılım (backpropagation) sırasında gradyanların ağın giriş katmanlarına doğru ilerledikçe üstel biçimde küçülmesi ve pratikte sıfıra yaklaşmasıyla ortaya çıkan eğitim istikrarsızlığıdır. Bu durum, girişe yakın katmanların neredeyse hiç güncellenmemesine ve dolayısıyla ağın düzgün öğrenememesine yol açar. Sorunun matematiksel kökü, zincir kuralındaki çarpım yapısındadır. Sigmoid veya tanh aktivasyon fonksiyonlarının türevleri en fazla 0.25 değerini alır; bu nedenle L katmanlı bir ağda gradyan, geri yayılım sırasında her katmanda bu faktörle çarpılarak L. kuvvet kadar küçülür. 10 katmanlı bir ağda 0.25^10 ≈ 0.000001'lik bir küçülme, girişe yakın ağırlıkların güncellenmesini fiilen imkânsız hale getirir. Problem ilk kez Sepp Hochreiter tarafından 1991'deki diplom tezinde sistematik olarak analiz edilmiştir. Modern derin öğrenme, bu sorunu büyük ölçüde çözen birkaç teknik geliştirmiştir. **ReLU (Rectified Linear Unit)** aktivasyon fonksiyonu, pozitif değerler için türevi sabit 1 olarak tutar; bu sayede gradyan çarpımları zincirde birikmez. **Batch Normalization**, her katmanın çıkışını normalize ederek gradyan akışını düzenler ve çok daha derin ağların eğitilmesini mümkün kılar. **Skip Connection (artık bağlantı)**, He et al.'ın ResNet makalesinde (2015) önerilmiş; gradyanın katmanları atlayarak doğrudan önceki katmanlara akmasını sağlar ve 152 katmanlı ağların başarıyla eğitilmesine olanak tanımıştır. **LSTM (Long Short-Term Memory)**, kaybolan gradyan problemini aşmak amacıyla özel hücre geçiti mekanizmasıyla tasarlanmış bir RNN mimarisidir; Hochreiter & Schmidhuber tarafından 1997'de önerilmiştir. Kaybolan gradyan probleminin karşıtı olan **Patlayan Gradyan (Exploding Gradient)** sorununda ise gradyanlar kontrol edilemez biçimde büyür. Bu ikisi birlikte derin öğrenmenin iki temel eğitim istikrarsızlığını oluşturur. Patlayan gradyan için gradient clipping (gradyan kırpma) tekniği yaygın biçimde kullanılır. Günümüzde bu sorunların çözülmüş olması, yüzlerce hatta binlerce katmanlı ağların başarıyla eğitildiği modern derin öğrenme mimarilerinin zeminini hazırlamıştır.
Prosodi (Prosodi)
Prosodi (İngilizce: prosody), konuşmadaki ton yüksekliği (pitch/F0), fonem süresi, ses enerjisi, vurgu ve duraklamalar gibi dil-üstü (suprasegmental) özelliklerin bütünüdür. Fonemler "ne söylendiğini" taşırken prosodi "nasıl söylendiğini" taşır: aynı cümle, pitch konturu değiştirildiğinde soru, ironi veya öfke anlamı kazanabilir. Yapay zeka tabanlı konuşma sentezinde (TTS) prosodi modellemesi, üretilen sesin insan konuşmasına yakınlığını belirleyen en kritik bileşendir; prosodi zayıfsa ses tek düze ve robotik duyulur. Teknik olarak prosodi dört ölçülebilir akustik parametreye dayanır: temel frekans (F0) konturu, fonem/hece süreleri, enerji (loudness) dağılımı ve sessizlik yerleşimi. Erken dönem birleştirmeli (concatenative) TTS sistemleri bu parametreleri elle yazılmış kurallarla üretirken, Tacotron 2 (2017) ve FastSpeech 2 (2020) gibi nöral modeller pitch, süre ve enerjiyi doğrudan veriden öğrenen açık öngörücüler (variance adaptors) kullandı. VITS ve StyleTTS 2 uçtan uca olasılıksal modellemeyle bu çizgiyi ileri taşıdı. 2024-2026 dalgasında ise ağırlık büyük dil modeli tabanlı ses üretimine kaydı: OpenAI'nin gpt-4o tabanlı Realtime sesi, ElevenLabs v3, Google'ın Gemini 2.5 native-audio çıkışı ve açık kaynak tarafında CosyVoice 2, F5-TTS ve Kokoro gibi modeller, metnin anlamsal ve duygusal bağlamından prosodi kararlarını örtük biçimde üretir; kullanıcı "fısıldayarak söyle" veya "[excited]" gibi doğal dil ve etiket yönergeleriyle tonlamayı yönlendirebilir. Prosodi yalnızca sentezin değil, konuşma tanımanın (ASR) ve konuşma-LLM etkileşiminin de konusudur: Whisper gibi modeller noktalama ve cümle sınırı kararlarında prosodik ipuçlarından örtük olarak yararlanır; sesli asistanlarda konuşma sırası (turn-taking) tespiti büyük ölçüde prosodiye dayanır. Türkçe gibi sondan eklemeli ve soru ekiyle (-mı/-mi) çalışan dillerde, dile özgü vurgu ve tonlama örüntülerinin modellenmesi sentez doğallığını belirgin biçimde artırır; akademik çalışmalar dile özgü prosodi kurallarının algılanan doğallıkta ölçülebilir iyileşme getirdiğini gösterir.
Residual Network (ResNet) (Artık Ağ (ResNet))
Residual Network (ResNet), derin sinir ağlarındaki gradyan kaybı problemini atlama bağlantıları (skip connections) ile çözen ve yüzlerce katmanlı ağların eğitimini mümkün kılan derin öğrenme mimarisidir. 2015 yılında Kaiming He, Xiangyu Zhang, Shaoqing Ren ve Jian Sun tarafından Microsoft Research'te geliştirildi; "Deep Residual Learning for Image Recognition" makalesi 250 binden fazla atıfla derin öğrenme tarihinin en çok referans verilen çalışmalarından biridir. ResNet-152, ILSVRC 2015 (ImageNet) yarışmasını yüzde 3,57 top-5 hata oranıyla kazandı ve insan seviyesi kabul edilen yüzde 5 sınırının altına indi. ResNet'ten önce ağ derinleştikçe doğruluk artacağına düşüyordu: 56 katmanlı düz bir ağ, 20 katmanlı olandan hem eğitim hem test setinde daha kötü sonuç veriyordu. Bu bozunma (degradation) sorununun kaynağı, geri yayılım sırasında hata sinyalinin katmanlar boyunca üstel olarak küçülmesi, yani gradyan kaybıydı. ResNet'in temel fikri artık öğrenmedir (residual learning). Klasik bir katman hedef dönüşüm H(x)'i doğrudan öğrenmeye çalışır; ResNet bloğu ise yalnızca artığı, F(x) = H(x) − x farkını öğrenir ve çıktıyı F(x) + x toplamıyla üretir. Eklenen kimlik kısayolu (identity shortcut) ek parametre getirmez, gradyanın alt katmanlara engelsiz akmasına izin verir ve bir katmanın işlevsiz kalması gerektiğinde F(x)'in sıfıra itilmesini yeterli kılar. Varyantlar katman sayısıyla anılır: ResNet-18, 34, 50, 101 ve 152. ResNet-50'den itibaren 1×1 → 3×3 → 1×1 konvolüsyonlu bottleneck bloklar hesap yükünü düşürür; ResNet-50 yaklaşık 25,6 milyon parametre ve 4,1 GFLOP ile hız-doğruluk dengesinin endüstri standardı olmuştur. Artık bağlantı fikri bilgisayarla görmenin ötesine taştı: Transformer mimarisinin her katmanı, dolayısıyla GPT-5, Claude Opus 4.5 ve Gemini 3 gibi 2026'nın büyük dil modelleri aynı prensiple çalışan bir residual stream üzerine kuruludur. Nesne tespiti (Faster R-CNN, YOLO ailesi), anlamsal bölütleme, tıbbi görüntü analizi ve uydu görüntüsü işleme alanlarında ResNet omurgaları hâlâ referans modeldir.
Skip Connection (Atlama Bağlantısı)
Skip connection (atlama bağlantısı), derin sinir ağı mimarilerinde bir katmanın girdisinin bir veya daha fazla katman atlanarak ileriki bir katmana doğrudan iletilmesi tekniğidir. 2015 yılında Microsoft Research ekibinin ResNet (Residual Network) mimarisinde popüler hale getirdiği bu yapı, derin öğrenme tarihinin en etkili mimari yeniliklerinden biri olarak kabul edilmektedir. Derin sinir ağlarının temel sorunu, gradyan kaybı (vanishing gradient) problemidir: geri yayılım (backpropagation) sırasında hata sinyali katmanlar boyunca üstel biçimde küçülerek iletilir ve en alt katmanlar öğrenme sürecinden yetersiz yararlanır. 2015 öncesinde 20-30 katmanı aşan ağlar pratikte eğitilemiyordu. Skip connection bu sorunu köklü biçimde çözer. Mathematiksel olarak bir skip connection bloğu şu şekilde ifade edilir: çıktı = F(x) + x. Burada F(x) katmanların öğrendiği artık (residual) dönüşümü, x ise doğrudan iletilen kimlik terimidir. Bu toplama işlemi, gradyanın hem dönüşüm yolundan hem de kesintisiz kimlik yolundan geriye akabilmesini sağlar. Ağ artık hedef çıktıyı sıfırdan öğrenmek yerine yalnızca neyin değişmesi gerektiğini öğrenir; bu da eğitimi hem hızlandırır hem de stabilize eder. Skip connection, yalnızca bilgisayarla görme alanında değil, modern yapay zeka ekosisteminin tamamında kalıcı bir iz bırakmıştır. Transformer mimarisi her encoder ve decoder bloğunda skip connection ile katman normalizasyonunu (layer normalization) birleştiren yapıyı kullanır. GPT, BERT, ViT ve LLaMA gibi büyük dil modelleri ile görüntü dönüştürücülerinde bu tasarım ilkesi temel bir bileşen haline gelmiştir. U-Net medikal görüntülemede encoder-decoder bağlantıları için, DenseNet ise yoğun bağlantı blokları için farklı skip connection türleri kullanır. Skip connection'ın önemi, 2015 ImageNet yarışmasında ResNet-152'nin insan düzeyini aşan yüzde 3.57 hata oranıyla birinci gelmesiyle somutlaşmıştır. Bu sonuç, derin öğrenme topluluğunun ağ derinliğine bakışını kökten değiştirmiş ve yüzlerce hatta binlerce katmanlı modellerin eğitilmesinin önünü açmıştır.
Softmax (Softmax Fonksiyonu)
Softmax fonksiyonu, yapay sinir ağlarında çok sınıflı sınıflandırma görevlerinde kullanılan temel matematiksel dönüşümdür. Ham model çıktıları olan logit vektörünü alır ve tüm elemanları (0, 1) aralığında, toplamı tam olarak 1'e eşit olan bir olasılık dağılımına dönüştürür. Matematiksel formülü σ(zᵢ) = exp(zᵢ) / Σⱼ exp(zⱼ) şeklindedir; her bileşen üstel fonksiyondan geçirilip normalize edilir. Fonksiyon, üstel doğası gereği büyük değerleri daha da büyütür, küçük değerleri bastırır. Bu sayede model en olası sınıfı ön plana çıkarır; sonuçlar doğrudan sınıf üyeliği olasılığı olarak yorumlanır. İkili sınıflandırma için kullanılan sigmoid fonksiyonunun her çıktıyı bağımsız olarak 0-1 aralığına sıkıştırmasından farklı olarak softmax, vektör düzeyinde çalışır ve sınıflar arasında rekabetçi normalizasyon yapar; toplamın daima 1 olması garantilendiğinden çıktılar doğru olasılık semantiği taşır. Sayısal kararlılık kritik bir konudur. Büyük logit değerlerinde exp(zᵢ) kayan nokta taşmasına yol açabilir. Standart çözüm, tüm bileşenlerden maksimum değeri çıkarmaktır: σ(zᵢ) = exp(zᵢ − max(z)) / Σⱼ exp(zⱼ − max(z)). Bu form matematiksel olarak özdeştir ama üstel değerleri kontrol altında tutar. PyTorch, TensorFlow ve NumPy bu optimizasyonu dahili olarak uygular. Sıcaklık ölçeklendirmesi (temperature scaling), fonksiyonun davranışını ayarlamak için kullanılır: Softmax(z / T). T = 1 standart çıktı, T büyüdükçe daha yayvan ve belirsiz bir dağılım, T küçüldükçe ise daha keskin ve kararlı bir dağılım ortaya çıkar. Bilgisinin damıtımı (knowledge distillation) tekniğinde yüksek sıcaklık kullanılarak öğretmen modelin logitleri yumuşatılır; öğrenci model sert etiketler yerine bu yumuşak hedefleri öğrenerek daha iyi genelleme yapar. Transformers mimarisindeki dikkat mekanizmasında da softmax merkezi bir rol üstlenir. Sorgu (Q) ve anahtar (K) matrislerinin nokta çarpımı hesaplanır; boyut ölçeklendirmesiyle √d_k'ya bölünür, ardından softmax uygulanarak her sorgu pozisyonu için dikkat ağırlıkları elde edilir: Attention(Q, K, V) = softmax(QK⊤ / √d_k) · V. Burada softmax iki işlevi bir arada yerine getirir: ağırlıkların toplamını 1'e normalize eder ve modelin seçici odaklanmasını destekler.
Layer Normalization (Katman Normalizasyonu)
Layer Normalization (Katman Normalizasyonu), derin öğrenme modellerinde eğitimi hızlandırmak ve kararlılaştırmak için kullanılan bir normalizasyon yöntemidir. Jimmy Ba ve Geoffrey Hinton tarafından 2016 yılında önerilen bu teknik, her bir veri örneğinin aktivasyonlarını özellik boyutu (feature dimension) üzerinden normalleştirir; bu sayede batch boyutundan tamamen bağımsız biçimde çalışır. Yöntemin matematiksel temeli şudur: bir katmandaki H adet nöronun aktivasyonları için μ (ortalama) ve σ (standart sapma) hesaplanır, ardından her aktivasyon normalize edilir ve öğrenilebilir parametreler γ (gain) ile β (bias) ile yeniden ölçeklenir. Formül: ŷ = γ × (x − μ) / √(σ² + ε) + β. Burada ε sıfıra bölmeyi önleyen küçük bir sabittir. Batch Normalization (BN) mini-batch içindeki tüm örneklere bakarak istatistik hesaplarken, Layer Normalization yalnızca tek örneğin kendi özellik boyutuna bakar. Bu fark, BN'nin değişken uzunluklu dizilerle ve batch size=1 senaryolarında yetersiz kalmasına yol açar; LN bu sınırlamaları aşar ve Tekrarlayan Sinir Ağları (RNN) ile Transformer mimarileri için doğal seçim haline gelir. Modern büyük dil modellerinde iki yerleşim biçimi bulunur. Orijinal Transformer (Vaswani ve ark., 2017) her alt katmanın (dikkat + FFN) çıktısından sonra LN uygular; buna Post-LN denir. GPT-3, LLaMA ve çoğu modern LLM ise her alt katmanın girişine LN uygular (Pre-LN). Pre-LN, gradyan akışını daha kararlı kılar ve genellikle daha kolay eğitilir. RMSNorm, Layer Norm'un hesaplama maliyetini azaltmak için önerilmiş bir varyantıdır. Ortalama çıkarma (mean subtraction) adımını atlayarak yalnızca karekök ortalama karesiyle (RMS) normalleştirir. LLaMA 2/3 ve Mistral gibi modeller RMSNorm'u tercih eder çünkü GPT düzeyinde kaliteyi daha az işlemle elde eder. Layer Normalization, eğitim sırasında model aktivasyonlarını ölçek ve kayma bağımsız hale getirerek öğrenme hızı seçimini daha az kritik kılar ve farklı boyutlardaki modeller arasında transferi kolaylaştırır.
Liquid Neural Network (Sıvı Sinir Ağları)
Liquid Neural Network (Sıvı Sinir Ağı), MIT CSAIL'den Ramin Hasani ve Mathias Lechner liderliğindeki ekibin 2020 yılında yayımladığı, zamanla değişen dinamik ağırlıklarla çalışan bir sinir ağı mimarisidir. "Sıvı" metaforu, ağırlıkların eğitim tamamlandığında dondurulması yerine her yeni girdi ile birlikte akışkan biçimde uyum sağlamasına gönderme yapar; bu durum modeli, özellikle zaman boyutu kritik olan görevler için doğası gereği elverişli kılar. Mimarinin çıkış noktası, yalnızca 302 nörona ve yaklaşık 7.000 sinapsa sahip C. elegans adlı nematod solucanının sinir sistemidir. Bu minimalist yapı; koku takibi, ışık hassasiyeti ve karmaşık sensorimotör davranışlar gibi işlevleri başarıyla yönetebilmektedir. MIT ekibi bu organizmanın nöral devrelerini matematiksel olarak modelleyerek Liquid Time-Constant (LTC) adı verilen temel yapı taşını geliştirdi. Teknik açıdan LTC hücresi, zaman sabitinin (τ) girdiye bağlı olarak değiştiği sürekli zamanlı diferansiyel denklem üzerine kurulur: dx/dt = -x/τ(x,I) + f(x,I). Bu denklem her zaman adımında Euler veya Runge-Kutta gibi ODE çözücüleriyle nümerik olarak ilerletilir. Klasik LSTM veya GRU ağlarının aksine, her girdi hücrenin iç dinamiğini geçici olarak etkiler; bu nedenle ağ statik değil, sürekli değişen bir temsil yapısı sunar. Pratik açıdan mimari, otonom araç sterzo kontrolünde standart LSTM'den %26 daha iyi genelleme sağladığı gösterilmiştir. Daha az parametreyle aynı temsil kapasitesine ulaşılması, düşük kaynaklı kenar cihazlarda (MCU, IoT) gerçek zamanlı çıkarım için önemli bir avantaj yaratır. Gürültülü veya eksik veri koşullarında sergilediği gürbüzlük, endüstriyel sensör izleme ve tıbbi sinyal analizi (EEG, EKG) gibi kritik alanlarda tercih nedeni olmaktadır. Eğitim sürecindeki temel zorluk, ODE çözücü adımlarının paralel GPU hesaplamasını güçleştirmesidir. Bu sınırlamayı aşmak için 2022'de Closed-Form Continuous-Time (CfC) mimarisi tanıtıldı; ODE yerine kapalı analitik form kullanarak eğitim süresini belirgin biçimde kısalttı. Ekibin 2023'te kurduğu Liquid AI şirketi bu temeli endüstriyel ölçeğe taşıyan modeller geliştirmektedir.
ReLU (Doğrultulmuş Doğrusal Birim)
ReLU, yapay sinir ağlarında nöronların çıktısını belirleyen bir aktivasyon fonksiyonudur. Formülü basittir: girdi sıfırdan büyükse olduğu gibi geçer, sıfır veya altındaysa sıfır döner. Bu basitlik, derin ağlarda on yıl boyunca hâkim olan sigmoid ve tanh fonksiyonlarının yerini almasının asıl nedenidir. Sigmoid ve tanh, girdi değerleri çok büyüdüğünde ya da çok küçüldüğünde gradyanları neredeyse sıfıra yaklaştırır. Geri yayılım sırasında bu küçük gradyanlar katman katman çarpılır; on, yirmi katmanlı bir ağda en baştaki katmanlara ulaşan gradyan fiilen yokolur. Ağırlıklar güncellenemez, ağ öğrenemez. Bu soruna kaybolan gradyan problemi denir ve 1990'larda derin ağ araştırmalarının önündeki en büyük engellerden biriydi. ReLU bu problemi doğrudan çözer. Pozitif girdiler için gradyan her zaman 1'dir; çarpma işlemi değeri küçültmez. Bunun yanı sıra üs veya üstel fonksiyon gerektirmediğinden hesaplaması sigmoid ve tanh'a göre çok daha hızlıdır. GPU'larda paralel işlem yapıldığında bu fark büyük ağlarda ciddi zaman tasarrufuna dönüşür. Pratikteki etkisi 2012 AlexNet modeliyle belgelenmiştir. Krizhevsky ve ekibi, aynı mimaride sigmoid yerine ReLU kullanarak eğitim süresini altıda bire indirmiştir. O tarihten bu yana derin öğrenmede gizli katman aktivasyonu denildiğinde varsayılan seçenek ReLU olmuştur. Ancak ReLU kusursuz değildir. Negatif girdi alan nöronlar sürekli sıfır çıktısı üretir ve gradyanları sıfır olduğundan bir daha güncellenemezler. Buna ölü ReLU problemi denir. Yüksek öğrenme hızı kullanıldığında veya ağırlıklar olumsuz başlatıldığında ağdaki nöronların önemli bir kısmı bu duruma düşebilir. Bu soruna karşı geliştirilen varyantlar mevcuttur: Leaky ReLU negatif girdiler için küçük bir eğim (genellikle 0,01) kullanır. PReLU bu eğimi öğrenilebilir bir parametre haline getirir. ELU negatif bölgede üstel bir eğri kullanarak ortalama aktivasyonu sıfıra yaklaştırır. GELU ise girdiyi bir olasılık ağırlığıyla çarpar ve özellikle dil modellerinde (BERT, GPT) tercih edilir. ReLU bugün evrişimli sinir ağlarında, derin tam bağlantılı ağlarda ve görüntü sınıflandırma modellerinin büyük çoğunluğunda gizli katman aktivasyonu olarak kullanılmaktadır.