category Yapay Sinir Ağları
Yapay Sinir Ağları kategorisi, yapay zeka ve makine öğrenimi alanındaki 47 temel terim ve kavramı kapsar: Artificial Neural Networks (ANN), Batch Normalization, Boltzmann Machine, Catastrophic Forgetting, Cross-Entropy, Deep Belief Network. Her terim için tanım, örnek ve ilgili kavramları bu sayfadan keşfedebilirsiniz.
Artificial Neural Networks (ANN) (Yapay Sinir Ağları)
Yapay sinir ağları (Artificial Neural Networks — ANN), insan beynindeki biyolojik nöron yapılarından esinlenerek geliştirilen matematiksel hesaplama modellerdir. Birbirine ağırlıklı bağlantılarla bağlı düğümlerden (nöronlardan) oluşan bu yapılar; girdi katmanı, bir ya da daha fazla gizli katman ve çıktı katmanından meydana gelir. Her düğüm gelen sinyalleri toplar, ağırlıklarla çarpar ve sonucu sigmoid, ReLU veya tanh gibi bir aktivasyon fonksiyonundan geçirerek bir sonraki katmana iletir. Eğitim süreci iki temel aşamadan oluşur: ileri geçiş (forward pass) sırasında girdi verisi katmanlar boyunca aktarılarak tahmin üretilir; geri yayılım (backpropagation) aşamasında ise tahmin hatası zincir kuralıyla geriye doğru hesaplanarak ağırlıklar gradyan iniş yöntemiyle güncellenir. Bu döngü milyonlarca iterasyon boyunca tekrarlanarak modelin doğruluğu kademeli biçimde artırılır. Ağın başarısı büyük ölçüde gizli katman sayısına, nöron yoğunluğuna ve seçilen optimizasyon algoritmasına (Adam, SGD, RMSProp) bağlıdır. Tarihsel açıdan McCulloch-Pitts nöronu (1943) ve Frank Rosenblatt'ın 1958 perceptronu bu alanın temel taşlarını oluşturur. İki "yapay zeka kışı" döneminde ilgi azalsa da 2006 sonrasında Geoffrey Hinton ve ekibinin çok katmanlı yapılar üzerindeki çalışmaları ile 2012'de AlexNet'in ImageNet yarışmasındaki devrimsel başarısı, modern derin öğrenme çağını başlattı. Günümüzde yapay sinir ağları pek çok uzmanlaşmış mimaride gelişmiştir: evrişimsel sinir ağları (CNN) görüntü tanıma ve bilgisayarlı görüde, yinelemeli ağlar (RNN/LSTM) dizi verisinde, grafik sinir ağları (GNN) ilişkisel veride ve transformerlar büyük dil modellerinde temel yapı taşını oluşturur. Tıbbi görüntü analizi, otonom araçlar, ses tanıma, makine çevirisi ve öneri sistemleri bu teknolojinin en olgunlaştığı başlıca uygulama alanlarıdır. Temel sınırlamalar arasında "kara kutu" yorumlanabilirlik sorunu, büyük miktarda etiketli eğitim verisi gerektirme ve GPU hesaplama maliyeti sayılabilir. Bu güçlükler açıklanabilir yapay zeka (XAI) araştırmalarını ve enerji verimli kenar bilişim (edge AI) çözümlerine olan ilgiyi giderek artırmaktadır.
Batch Normalization (Toplu Normalleştirme)
Batch Normalization (Toplu Normallesme), derin sinir aglarinin egitimi sirasinda her katmanin aktivasyonlarini mini-batch istatistiklerini kullanarak normalize eden ve bu sayede egitimi hizlandirip kararlilastiran bir tekniktir. 2015 yilinda Ioffe ve Szegedy tarafindan yayimlanan makale, BN'yi derin ogrenme camiasinin standart yontemlerinden biri haline getirdi. BN algoritmasini adim adim inceleyelim. Her mini-batch icin, hedef katmanda gelen aktivasyonlarin batch ortalamasisi ve varyansi hesaplanir. Bu istatistiklerle aktivasyonlar normalize edilir, yani ortalama 0, varyans 1 olur. Ardindan iki ogrenilir parametreyle (gama, beta) yeniden olcelkendirme yapilir: gama aktivasyonlarin olcegini, beta ise kaydirmasini belirler. Bu yeniden olceklendirme adimi, normalizasyonun modelin ifade gucunu kisitlamamasini saglar; model gerekirse orijinal dagilima benzer bir ciktiya geri donebilir. BN'nin en onemli pratik faydasi egitimin hizlanmasidir. Normallesme, gradyanlarin katmanlar arasinda daha tutarli bir buyuklukle akmasini saglar; bu cok daha yuksek learning rate kullanimi ve daha az epoch ile yakinsama anlamina gelir. Bazi deneyler BN'nin egitimi 5-10 kat hizlandirabildigini gostermistir. Mekanizma tartismali olsa da BN, "internal covariate shift" sorununu azalttigini iddia eden yaklasimla tanitilmistir. Derin ag egitiminde alt katmanlardaki agirlik guncellemeler, ust katmanlarin girdi dagilimini surdurur degistirir; bu degisim ogrenmeyi yavaslattir. BN her katmanin girdi dagilimini dengeleyerek bu sorunu azaltir. Transformer mimarisinin yayginlasmisiyla Layer Normalization (LayerNorm) on plana cikmiştir. LayerNorm batch boyutu yerine ozellik boyutu uzerinden normalizasyon yapar; tek ornekle de calistigindan RNN ve Transformer'larda tercih edilir. **Sik Sorulan Sorular** **Batch Normalization hangi konuma yerlestirilir?** Geleneksel olarak lineer katman veya evrisme katmani ile aktivasyon fonksiyonu arasina yerlestirilir. Ancak "pre-activation" yaklasiminda aktivasyondan once konumlandirma da kullanilir; performans farkli mimarilerde degisebilir. **Kucuk batch size'larda BN calisir mi?** Kucuk batch'lerde BN'nin istatistiksel tahminleri guvenilmez hale gelebilir. Bu durumda Group Normalization veya Layer Normalization daha kararlı alternatiflerdir. **BN neden inference'ta farkli davranir?** Egitimde mini-batch istatistikleri kullanilirken inference'ta egitim boyunca biriktirilen hareketli ortalama (running mean/variance) kullanilir. Bu model eval() ve train() modlari arasindaki farkliliktan kaynaklanir. **Transformer'lar neden LayerNorm kullanir?** Transformer'larin sekanslar ve self-attention yapilariyla calismasi, batch boyutuna bagli bir normalizasyonu pratik kilmaz. LayerNorm her ornegi bagimsiz normalize ettiginden bu mimariyle dogal bir uyum icindedir.
Boltzmann Machine (Boltzmann Makinesi)
Boltzmann Makinesi, 1985 yılında Geoffrey Hinton ve Terry Sejnowski tarafından geliştirilen, enerji tabanlı bir stokastik üretken sinir ağı modelidir. Model, görünür (visible) birimler ve gizli (hidden) birimler olmak üzere iki tür ikili stokastik nörondan oluşur; tüm birimler birbirine simetrik ağırlıklı bağlantılarla bağlıdır. Sistemin temel prensibi enerji minimizasyonuna dayanır. Her ağırlık konfigürasyonunun bir enerji değeri vardır; model, Boltzmann dağılımına göre düşük enerjili durumları yüksek olasılıkla örnekleyerek eğitim verisinin olasılık dağılımını öğrenir. Bu öğrenme süreci Contrastive Divergence (CD) algoritmasıyla gerçekleştirilir; tam Gibbs örneklemesi yerine k adımlı yaklaşım kullanılarak hesaplama yükü azaltılır. Tam bağlantılı Boltzmann Makinesi'nin eğitimi son derece yavaş olduğundan pratikte Kısıtlı Boltzmann Makinesi (Restricted Boltzmann Machine, RBM) tercih edilir. RBM'de görünür birimler yalnızca gizli birimlere bağlıdır; görünür-görünür ve gizli-gizli bağlantılar yoktur. Bu kısıtlama, katmanlar arasında paralel Gibbs örneklemesine olanak tanır ve eğitimi önemli ölçüde hızlandırır. RBM'ler 2006-2012 yılları arasında derin öğrenmenin öncü uygulamalarında kritik rol üstlenmiştir. Hinton'ın 2006 makalesinde sunulan Derin İnanç Ağları (Deep Belief Networks, DBN), birden fazla RBM katmanını açgözlü bir biçimde önceden eğiterek derin mimarilerin başarıyla eğitilebileceğini göstermiş ve modern derin öğrenme çağının kapısını aralamıştır. Aynı dönemde Netflix Ödülü yarışmasında işbirlikçi filtreleme amacıyla da başarıyla uygulanmıştır. Günümüzde VAE (Değişimsel Öz-Kodlayıcı), GAN ve difüzyon modelleri gibi daha güçlü ve ölçeklenebilir üretken yaklaşımların yaygınlaşmasıyla Boltzmann Makinesi'nin pratik kullanımı büyük ölçüde geride kalmıştır. Ancak enerji tabanlı modelleme konsepti modern yapay zeka mimarilerini kavramak için önemli bir teorik temel sunmaya devam etmektedir. Geoffrey Hinton, bu çalışmanın da dahil olduğu derin öğrenme katkıları nedeniyle 2024 Nobel Fizik Ödülü'ne layık görülmüştür. Model, yapay zeka tarihinde hem kavramsal hem de pratik açıdan derin izler bırakmış, günümüzün gelişmiş mimarilerine giden yolun önemli taşlarından birini oluşturmuştur.
Catastrophic Forgetting (Yıkıcı Unutma)
Yıkıcı Unutma (Catastrophic Forgetting ya da Catastrophic Interference), yapay sinir ağlarının yeni bir görev için eğitildiğinde önceki görevlerde öğrendikleri bilgileri ani ve büyük ölçüde yitirmesi olgusudur. İlk kez 1989'da McCloskey ve Cohen tarafından bağlantıcı modelleri inceleyen bir çalışmada tanımlanmış; Ratcliff (1990) ise olgunun teorik temellerini genişletmiştir. Temel mekanizma, geri yayılım (backpropagation) algoritmasının tüm ağırlıkları güncellemesinden kaynaklanır. Model yeni görev verisiyle eğitildiğinde ağırlık güncellemeleri, önceki görev için optimize edilmiş değerlerin doğrudan üzerine yazar. İnsan beyninin hipokampal konsolidasyon mekanizması sayesinde yeni bilgiyi eskiyi bozmadan entegre edebildiği düşünüldüğünde, standart yapay sinir ağlarının bu dezavantajı açıkça ortaya çıkar. Bu sorunu aşmak için üç temel strateji geliştirilmiştir. Düzenleme (regularization) tabanlı yöntemler, önceki görevler için kritik ağırlıkları belirleyerek bu ağırlıkların değişimini kısıtlar; en bilineni Elastic Weight Consolidation (EWC)'dir. EWC, Fisher bilgi matrisini kullanarak her ağırlığın önceki görev için ne kadar önemli olduğunu hesaplar ve buna göre L2 cezası uygular. Bellek tekrarı (memory replay) yöntemleri, geçmiş görevlerin örneklerini bir tampon bellekte saklar ya da üretici modeller aracılığıyla sentetik olarak yeniden oluşturarak yeni eğitimle karıştırır. Mimari genişleme yöntemleri ise her yeni görev için ağa ek parametreler ekler ve eski ağırlıkları dondurur; Progressive Neural Networks (PNN) ve PackNet bu yaklaşımın en bilinen örnekleridir. Yıkıcı unutma, büyük dil modellerinin güncellenmesi, robotik sistemlerin yeni beceriler kazanması ve kişiselleştirme uygulamalarında kritik bir engel oluşturmaktadır. 2020'lerin ortasında araştırmacılar, LoRA gibi parametre-verimli ince ayar yöntemleriyle EWC ve replay tekniklerini birleştiren hibrit yaklaşımlar geliştirerek bu sorunu LLM'ler bağlamında ele almaktadır. Yıkıcı unutmayı aşabilen sistemler, yapay genel zekaya (AGI) giden yolda zorunlu bir adım olarak kabul görmektedir.
Cross-Entropy (Çapraz Entropi)
Çapraz Entropi (Cross-Entropy), sınıflandırma görevlerinde derin öğrenme modellerinin eğitiminde kullanılan en yaygın kayıp fonksiyonudur. Bilgi teorisinden türetilen bu metrik, modelin ürettiği olasılık dağılımının gerçek etiket dağılımıyla ne kadar uyuştuğunu ölçer; fark büyüdükçe kayıp artar ve model parametrelerini güncellemek için daha güçlü bir gradyan sinyali üretilir. Matematikte entropi, bir olayın ne kadar "sürpriz" olduğunu ölçer: nadir olaylar yüksek, yaygın olaylar düşük bilgi içerir. Çapraz entropi ise iki dağılım arasındaki bilgi kaybını ölçer. İkili sınıflandırma (binary classification) için formül: L = −[y·log(ŷ) + (1−y)·log(1−ŷ)]. Burada y gerçek etiket (0 veya 1), ŷ modelin tahmin ettiği olasılıktır. Model yanlış sınıf için yüksek olasılık verdiğinde log terimi sonsuz büyüklüğe yaklaşarak kayıp patlar; bu matematiksel baskı modeli doğru sınıfa yönlendirir. Çok sınıflı sınıflandırma (multi-class) için kategorik çapraz entropi kullanılır: L = −Σ yᵢ·log(ŷᵢ). Doğru sınıfa karşılık gelen terim dışındaki tüm yᵢ değerleri 0 olduğundan, kayıp yalnızca gerçek sınıfın tahmin olasılığına bağlıdır. Softmax aktivasyonu ile birlikte doğal bir eşleşme oluşturur: softmax çıktıları toplamı 1 olan olasılık dağılımı üretir, çapraz entropi bu dağılımla gerçek etiketi karşılaştırır. Çapraz entropi, ortalama karesel hata (MSE) yerine sınıflandırmada neden tercih edilir? MSE, olasılık tahminleri için zayıf gradyanlar üretir: model doğru etikete 0.9 olasılık verirken yanlış yönde ilerlese bile MSE gradyanı küçük kalır. Çapraz entropi ise logaritmik yapısı sayesinde yanlış sınıflara yüksek olasılık veren kötü tahminleri çok daha sert cezalandırır. Eğitimde dikkat edilmesi gereken bir nokta sayısal kararlılıktır: log(0) tanımsızdır. PyTorch ve TensorFlow gibi kütüphaneler log hesaplamasını softmax ile birleştirerek (log-sum-exp trick) bu problemi çözer; `nn.CrossEntropyLoss()` PyTorch'ta softmax + log + NLL kaybını tek adımda uygular. **Label smoothing**, gerçek etiketleri yumuşatarak (ör. 1.0 yerine 0.9, 0.0 yerine 0.1) aşırı güveni önleyen bir çapraz entropi varyantıdır. Model çok eminleştiğinde genelleme kapasitesi düşer; label smoothing bunu hafifletir ve modern transformerların eğitiminde standart hale gelmiştir.
Deep Belief Network (Derin İnanç Ağı)
Derin İnanç Ağı (Deep Belief Network — DBN), birden fazla Kısıtlı Boltzmann Makinesi'nin (Restricted Boltzmann Machine — RBM) hiyerarşik olarak yığıldığı olasılıksal bir derin öğrenme modelidir. Her katman, bir alt katmanın gizli birimlerini temsil ederken bir üst katmanın görünür birimleri olarak işlev görür; böylece veri içindeki soyutlama düzeyi ağın derinliğiyle birlikte artar. Ham veriden başlayarak pikseller, kenarlar, şekiller ve nesneler gibi giderek daha soyut temsiller öğrenir. Modelin tarihsel önemi, Geoffrey Hinton, Simon Osindero ve Yee-Whye Teh'in 2006 yılında Science dergisinde yayımladığı dönüm noktası niteliğindeki makaleden kaynaklanmaktadır. Bu çalışma, derin ağların eğitimindeki temel güçlük olan kaybolan gradyan (vanishing gradient) sorununa pratik bir çözüm sundu: Açgözlü katman-bazlı ön eğitim (greedy layer-wise pretraining). Bu yaklaşımda her RBM katmanı, alttaki katmanın çıktısını girdi olarak alarak bağımsız ve denetimsiz biçimde eğitilir. Ardından tüm ağ, denetimli ince ayar (supervised fine-tuning) ile geri yayılım algoritması kullanılarak optimize edilir. Bir RBM, görünür ve gizli olmak üzere iki katmanlı enerji tabanlı bir olasılıksal modeldir. Kısıtlı sıfatı, aynı katmandaki birimler arasında bağlantı bulunmadığını ifade eder; bu yapı tam Boltzmann makinelerine kıyasla eğitimi hesaplanabilir kılar. RBM eğitiminde Contrastive Divergence (CD-k) algoritması kullanılır; bu yaklaşım maksimum olabilirlik tahminin pratikte uygulanabilir bir yaklaşımıdır. Pratik kullanım açısından DBN'ler 2006-2012 yılları arasında özellikle boyut indirgeme, özellik öğrenme, öneri sistemleri ve konuşma tanıma alanlarında öne çıktı. Carnegie Mellon ve Toronto Üniversitesi'nden ekipler, MNIST rakam tanıma kıyaslamasında dönemin en yüksek doğruluk oranlarını DBN ile elde etti. Microsoft Research, DBN tabanlı konuşma tanıma sistemleriyle hata oranını dramatik biçimde düşürdü. 2012'den itibaren Evrişimli Sinir Ağları (CNN) ve Uzun-Kısa Süreli Bellek (LSTM) ağlarının ImageNet ve konuşma tanımadaki başarıları, DBN'lerin kullanımını önemli ölçüde daralttı. Bununla birlikte DBN kavramı; modern üretken modellerin, özellikle Değişken Özkodlayıcılar (VAE) ve Difüzyon Modellerinin teorik zeminini anlama açısından hâlâ eğitim ve araştırma bağlamında incelenmektedir. Geoffrey Hinton, bu çalışmadaki katkıları da dahil olmak üzere derin öğrenme alanındaki başarıları nedeniyle 2018 Turing Ödülü'nü almış; 2024 yılında ise Nobel Fizik Ödülü'ne layık görülmüştür.
Derin Öğrenme (Derin Öğrenme)
Derin öğrenme (Deep Learning), insan beyninin sinir ağı yapısından esinlenerek tasarlanmış, çok katmanlı yapay sinir ağlarını kullanan bir makine öğrenimi alt disiplinidir. "Derin" nitelemesi, girdi ile çıktı arasındaki gizli katman (hidden layer) sayısının fazlalığından gelir; bu katmanlar veriden hiyerarşik temsiller öğrenir. Alt katmanlar kenar ve doku gibi düşük düzey özellikleri yakalarken üst katmanlar nesne veya kavram gibi soyut özellikleri kodlar. Alanın dönüm noktası 2012'deki AlexNet'tir: GPU hızlandırma ve büyük veri birleşiminin derin ağları eğitilir kıldığını kanıtlayan bu model, ImageNet yarışmasında önceki rekorları kırarak derin öğrenmeyi ana akıma taşıdı. Temel yapı taşı olan yapay nöron, gelen değerleri ağırlıklı toplar ve ReLU, sigmoid gibi bir aktivasyon fonksiyonundan geçirir. Eğitimde geri yayılım (backpropagation) algoritması, çıktı hatasını katman katman geriye taşıyarak her ağırlığın güncellenmesini sağlar; gradyan inişi (gradient descent) ise bu güncellemeleri yönetir. Adam ve AdamW gibi uyarlamalı optimizatörler öğrenme hızını otomatik olarak ayarlar. Başlıca mimari aileler şunlardır: CNN (evrişimsel sinir ağları) görüntü ve video işlemede standarttır; Transformer 2017'den itibaren NLP'yi ve ardından çok modlu sistemleri domine etmektedir; RNN/LSTM zaman serisi modellemesinde kullanılır; Difüzyon Modelleri görüntü ve ses üretiminde devrim yaratmaktadır. Uygulama alanları geniştir: tıbbi görüntüleme (kanser tespiti), otonom araçlar (nesne algılama), doğal dil işleme (makine çevirisi, metin üretme), konuşma tanıma ve öneri sistemleri. Türkiye'de e-ticaret platformlarının kişiselleştirme motorları, bankacılık sektörünün dolandırıcılık tespit sistemleri ve Türkçe NLP projeleri derin öğrenmeye dayanmaktadır. Transfer öğrenme, milyonlarca örnekle önceden eğitilmiş modelleri yüzlerce ya da binlerce örnekle yeni görevlere uyarlar; bu yaklaşım derin öğrenmeyi küçük veri setlerinde de kullanılabilir kılmaktadır. PyTorch ve TensorFlow başlıca açık kaynak çerçevelerdir; Hugging Face ekosistemi binlerce hazır modele erişim sunar. Temel sınırlamalar arasında büyük veri ve yüksek hesaplama gereksinimi, yorumlanabilirlik eksikliği (kara kutu sorunu) ve dağılım kayması (distribution shift) yer almaktadır. Araştırmacılar bu sorunları ele almak için yorumlanabilir yapay zeka (XAI) teknikleri ve verimli mimari tasarımları geliştirmeyi sürdürmektedir.
Dropout (Düzenlileştirme Tekniği)
Dropout, derin sinir ağı eğitimi sırasında her güncelleme adımında belirli bir olasılıkla (dropout oranı, p) gizli katman nöronlarının çıkışlarını sıfırlayan ve bu şekilde modelin belirli nöronlara bağımlılığını kıran bir düzenlileştirme tekniğidir. 2014 yılında Srivastava ve arkadaşları tarafından önerilen bu yöntem, derin öğrenme tarihinin en etkili yeniliklerinden biri olarak kabul görmektedir. Temel fikir, eğitim sırasında ağı sürekli değişen rastgele alt ağlar üzerinde çalıştırarak her nöronun diğer nöronların varlığına ya da yokluğuna göre hareket etmeyi öğrenmesini önlemektir. Bu mekanizma, ko-adaptasyonu (co-adaptation) kırar ve her nöronu bağımsız olarak yararlı özellikler çıkarmaya zorlar. Ağ böylece tek bir nörona veya nöron grubuna aşırı güvenmek yerine dağıtık temsiller öğrenir. Pratikte dropout oranı p=0.5, tam bağlı katmanlar için standart başlangıç noktası olarak yaygın biçimde kullanılmaktadır. Ancak giriş katmanlarında p=0.1-0.2, konvolüsyonel katmanlarda daha düşük değerler tercih edilir; bu katmanlarda zaten az parametre bulunduğundan çok yüksek dropout aşırı bilgi kaybına yol açabilir. Batch normalization ile birlikte kullanıldığında dikkatli olmak gerekir; ikisi arasındaki etkileşim bazen istenmeyen davranışlara neden olabilmektedir. Test aşamasında dropout tamamen devre dışı bırakılır; tüm nöronlar aktif kalır. Ağırlıklar eğitim sırasında kullanılan seyrelmeyi telafi etmek için (1−p) çarpanıyla ölçeklenir. Modern çerçeveler "inverted dropout" uygular: eğitim sırasında kalan nöronların çıkışları 1/(1−p) ile çarpılır, böylece test aşamasında ekstra işlem gerekmez. PyTorch'ta torch.nn.Dropout(p=0.5) ve Keras'ta layers.Dropout(0.5) ile tek satırda eklenir. Dropout ayrıca Bayesian derin öğrenmeyle de ilişkilendirilmektedir. Test zamanında da dropout açık tutularak birden fazla tahmin yapılırsa (MC Dropout), bu tahminlerin dağılımı modelin belirsizliğine dair istatistiksel bilgi üretir. Özellikle tıbbi teşhis ve otonom araç gibi güvenlik açısından kritik uygulamalarda bu özellik son derece değerlidir. Spatial Dropout ise konvolüsyonel ağlarda tüm özellik haritası kanallarını sıfırlayarak uzamsal bağıntıları daha etkili biçimde kırmaktadır.
Echo State Network (Yankı Durum Ağı)
Echo State Network (ESN), Reservoir Computing (Rezervuar Hesaplama) paradigmasına ait bir tekrarlayan yapay sinir ağı türüdür. 2001 yılında Herbert Jaeger tarafından Fraunhofer Enstitüsü'nde geliştirilen ESN, üç temel bileşenden oluşur: giriş katmanı, büyük ve sabit rastgele bağlantılı tekrarlayan bir rezervuar (tank) ve yalnızca bu rezervuarın çıktısının eğitildiği okuma (readout) katmanı. Geleneksel tekrarlayan sinir ağlarından (RNN) ve LSTM'lerden farklı olarak ESN'de giriş ve rezervuar bağlantı ağırlıkları rastgele belirlenir ve sabit tutulur; yalnızca çıkış ağırlıkları basit bir lineer regresyon yöntemiyle eğitilir. Bu yaklaşım eğitim sürecini dramatik biçimde hızlandırır ve derin ağlarda sıkça karşılaşılan gradyan kaybolması ile gradyan patlaması sorunlarını tamamen ortadan kaldırır. ESN'nin temel prensibi olan Yankı Durumu Özelliği (Echo State Property), ağın geçmiş girdi sinyallerinin etkisini zamanla unutarak mevcut girdi sinyaline bağımlı hale gelmesini garantiler. Bu özelliğin matematiksel güvencesi, rezervuarın spektral yarıçapının (en büyük özdeğerin mutlak değerinin) 1'den küçük tutulmasıdır. Bu koşul sağlandığında, farklı başlangıç durumlarından başlayan iki ESN, aynı girdi dizisi verildiğinde zamanla aynı rezervuar durumuna yakınsar. Pratik bir ESN, tipik olarak 100 ile 5000 arasında değişen nörondan oluşan bir rezervuar barındırır. Rezervuarın bağlantı yoğunluğu ve giriş ölçekleme (input scaling) gibi hiperparametreler görev tipine göre manuel olarak ayarlanırken yalnızca çıkış ağırlıkları fit edilir. Bu asimetrik eğitim stratejisi büyük ölçekli geri yayılım hesaplamalarını tamamen devre dışı bırakır. 2024-2025 döneminde katmanlı rezervuar mimarileri (Deep-ESN) hem bellek kapasitesini hem de hesaplama verimliliğini önemli ölçüde artırmıştır. Fotonik ESN deneyleri enerji tüketimi açısından yazılım tabanlı RNN'lere kıyasla büyük avantaj sunarken ReservoirPy gibi Python kütüphaneleri scikit-learn uyumlu iş akışlarına kolay entegrasyon imkânı tanımaktadır. Echo State Network, zaman serisi tahmininde, konuşma tanımada, kaotik sistemlerin modellemesinde ve robotik kontrolde tercih edilen bir mimaridir. Liquid Neural Network ve Spiking Neural Network gibi biyolojik ilhamlı yaklaşımlarla birlikte dinamik hesaplama araştırmalarının önemli bir parçasını oluşturmaktadır.
Encoder-Decoder (Kodlayıcı-Çözücü)
Encoder-decoder (kodlayıcı-çözücü), bir girdi dizisini veya veriyi sıkıştırılmış bir ara temsile dönüştüren (kodlama) ve ardından bu temsilden hedef çıktıyı yeniden üreten (çözme) iki bileşenli bir sinir ağı mimarisidir. Dizi-diziye (seq2seq) dönüşüm gerektiren görevlerde temel yapı taşı olan bu mimari, makine çevirisi, metin özetleme, konuşma tanıma ve görüntü açıklama gibi alanlarda geniş uygulama bulur. Encoder bileşeni, girdi dizisinin her öğesini işleyerek sabit boyutlu bir bağlam vektörü (context vector) veya dikkat ağırlıklı gizli durum kümesi üretir. RNN tabanlı encoder'larda bu çıktı son gizli durumdur; Transformer tabanlı mimarilerde ise her girdi tokenına karşılık gelen gizli durum vektörlerinin tamamı decoder'a aktarılır. Encoder, girdiyi sıkıştırırken semantik bilgiyi korumayı ve ilgisiz gürültüyü bastırmayı öğrenir. Decoder bileşeni, encoder çıktısını alarak hedef dizinin her adımını otoregresif biçimde üretir: bir önceki adımda üretilen token, sonraki token olasılığını hesaplamak için tekrar girdi olarak kullanılır. Eğitim sırasında "teacher forcing" yöntemiyle gerçek hedef tokenlar girdi olarak verilir; çıkarım (inference) aşamasında ise modelin kendi ürettiği tokenlar beslenir. Bu fark, "exposure bias" olarak adlandırılan ve beam search ile scheduled sampling yöntemleriyle azaltılmaya çalışılan bir eğitim-çıkarım uyumsuzluğuna yol açar. Dikkat mekanizması (attention mechanism) bu mimarinin kritik bir uzantısıdır. 2015 yılında Bahdanau ve ark. tarafından önerilen dikkat, decoder'ın her adımda encoder'ın farklı konumlarına farklı ağırlıklar atayarak odaklanmasını sağlar; bu sayede uzun dizilerdeki bilgi darboğazı önemli ölçüde azalır. Modern Transformer mimarisindeki çok başlı dikkat (multi-head attention), bu fikrin paralel ve güçlendirilmiş halidir; farklı temsil alt uzaylarında eş zamanlı dikkat hesaplanır. Günümüz büyük dil modellerinde BERT saf encoder, GPT ailesi saf decoder, T5 ve BART ise encoder-decoder modellerine örnektir. Görüntü işlemede U-Net, encoder-decoder prensibini piksel düzeyinde segmentasyon için atlama bağlantıları (skip connections) ile kullanır. Whisper (OpenAI) ise ses encoder ve metin decoder birleştirerek konuşma tanıma görevini büyük ölçekli eğitimle çözer.
GNN (Çizge Sinir Ağı) (GNN (Çizge Sinir Ağı))
GNN (Graph Neural Network — Çizge Sinir Ağı), düğümler ve kenarlardan oluşan graf yapısındaki veriler üzerinde mesaj geçişi mekanizmasıyla öğrenen derin öğrenme mimarisidir. CNN ve RNN gibi klasik modeller, piksel matrisleri veya sözcük dizileri biçiminde düzenlenmiş ızgara veriyle çalışırken, GNN'ler sosyal ağlar, moleküler yapılar, bilgi grafları ve trafik ağları gibi düzensiz topolojilerdeki ilişkisel veriyi doğrudan işleyebilir. Mesaj geçişi üç adımda gerçekleşir: Her düğüm komşularından özellik vektörleri alır (mesaj üretimi), bu vektörleri toplama veya ortalama gibi permütasyona duyarsız bir işlevle birleştirir ve ardından bir sinir ağı katmanıyla kendi temsilini günceller. Her GNN katmanında tekrarlanan bu döngü, k katmanla k-komşuluk yarıçapındaki bilgiyi yakalar; derin ağlar geniş mahallelerin bilgisini sentezler. Başlıca GNN mimarileri farklı toplama stratejileri kullanır. GCN (Kipf & Welling, 2017), spektral konvolüsyonu uzaysal alana yaklaştırarak sabit graflar üzerinde verimli çalışır. GAT, her komşuya öğrenilebilir dikkat ağırlıkları atayarak heterojen graflarda daha iyi genelleme yapar. GraphSAGE, büyük graflarda örneklem tabanlı komşu toplama yöntemiyle ölçeklenebilirliği artırır ve eğitim dışı düğümlere genelleyebilir. Graph Transformer ise dikkat mekanizmasını konum kodlamasıyla birleştirerek uzun menzilli ilişkileri yakalar; AlphaFold 2'nin protein katlanma tahmini bu yaklaşımdan yararlanır. GNN'ler kritik alanlarda yaygın biçimde kullanılır: ilaç keşfinde moleküler bağ tahminini gerçekleştirir, trafik modellemesinde Google Maps'in varış süresi sistemine katkıda bulunur, finansal sahtekârlık tespitinde işlem graflarını analiz eder ve öneri sistemlerinde kullanıcı-içerik ilişkilerini modeller. Pinterest'in PinSage modeli ve Meta'nın içerik öneri altyapısı GNN tabanlı sistemlerin öne çıkan örnekleridir. Geliştirme için PyTorch Geometric ve Deep Graph Library (DGL) en yaygın çerçevelerdir; her ikisi de hazır GNN katmanları ve büyük graflarda mini-batch öğrenmesi sunar. Open Graph Benchmark (OGB) ise standart değerlendirme veri setleri ve lider tablolarıyla araştırma kıyaslamalarına zemin hazırlar.
Gradient Descent (Gradyan İnişi)
Gradient descent (gradyan inişi), bir modelin kayıp fonksiyonunu minimize etmek için parametreleri gradyanın negatif yönünde iteratif olarak güncelleyen optimizasyon algoritmasıdır. Güncelleme kuralı tek satırdır: **θ ← θ − α · ∇L(θ)**. Burada θ model parametrelerini, ∇L(θ) kaybın parametrelere göre türevini (gradyanı), α ise adım büyüklüğünü belirleyen öğrenme hızını (learning rate) temsil eder. Doğrusal regresyondan 1 trilyon parametreli dil modellerine kadar neredeyse tüm modern makine öğrenmesi eğitimi bu kuralın bir varyantıyla yapılır. Sezgisel karşılığı, sisli bir dağda gözü bağlı vadiye inen bir yürüyüşçüdür: yürüyüşçü yalnızca ayağının altındaki eğimi hisseder ve her adımda en dik iniş yönüne ilerler. Eğim gradyana, adım boyu öğrenme hızına, vadinin dibi ise minimum hataya karşılık gelir. Adım çok büyükse vadi atlanır ve kayıp ıraksar; çok küçükse yakınsama saatler yerine haftalar alır. Pratikte üç ana biçimi vardır: tüm veri kümesini tek seferde işleyen **batch gradient descent**, her adımda tek örnek kullanan **stochastic gradient descent (SGD)** ve derin öğrenmenin fiili standardı olan, 16–4096 örneklik gruplarla çalışan **mini-batch gradient descent**. Derin sinir ağlarında gradyanlar geriye yayılım (backpropagation) ile zincir kuralı üzerinden hesaplanır; PyTorch ve JAX gibi kütüphaneler bunu otomatik türev (autograd) ile yapar. Güncelliği tartışmasızdır: GPT-5, Claude, Gemini ve Llama ailesi dahil bütün büyük dil modelleri, gradient descent'in uyarlanabilir türevleri olan AdamW ve 2025'ten itibaren yaygınlaşan Muon gibi optimizatörlerle eğitildi. Konveks problemlerde yakınsama matematiksel olarak kanıtlanmıştır; derin ağların non-konveks kayıp yüzeylerinde ise eyer noktaları (saddle point) ve düz plato bölgeleri asıl pratik zorluğu oluşturur. SGD'nin stokastik gürültüsü, paradoksal biçimde bu noktalardan kaçışı kolaylaştırır ve genelleme performansına katkı yapar. Kısacası gradient descent, yapay zekanın "öğrenme" dediğimiz sürecinin matematiksel motorudur.
Graph Attention Network (GAT) (Dikkat Mekanizmalı Çizge Sinir Ağı)
Graph Attention Network (GAT), çizge (graf) yapılı verilere dikkat mekanizması uygulayan bir yapay sinir ağı mimarisidir. Velickovic ve ekibi tarafından 2018'de ICLR konferansında önerilen GAT, bir düğümün temsilini güncellerken komşu düğümlere sabit ağırlık atamak yerine, her komşu için ayrı dikkat puanları hesaplayarak hangi komşuların daha önemli olduğunu veri odaklı biçimde öğrenir. GAT, bir düğüm ile her komşusu arasında dikkat katsayısı (attention coefficient) hesaplar. Bu katsayılar Leaky ReLU aktivasyonlu küçük bir sinir ağıyla üretilir ve softmax ile normalize edilir. Son düğüm temsili, komşu özelliklerinin bu ağırlıklı toplamından oluşur. Kararlılık ve farklı ilişki örüntülerini yakalamak için çok başlıklı dikkat (multi-head attention) kullanılır; ara katmanlarda başlık çıktıları birleştirilir, çıkış katmanında ortalaması alınır. Çizge Evrişimsel Ağ (GCN), tüm komşulara eşit ağırlık atarken GAT her komşunun önem derecesini veri odaklı biçimde öğrenir. Bu esneklik, değişken büyüklükteki komşuluk yapılarında ve karmaşık ilişkilerde GAT'a belirgin üstünlük sağlar. GNN (Graph Neural Network) ise bu tür tüm çizge sinir ağlarını kapsayan üst terimdir; GCN ve GAT, GNN'nin özel türleridir. GAT başlıca düğüm sınıflandırma, bağlantı tahmini ve çizge sınıflandırma görevlerinde kullanılır. Pratik uygulamalar arasında sosyal ağ analizi, ilaç-protein etkileşim tahmini, moleküler biyoloji, bilgi grafiği tamamlama ve içerik tabanlı öneri sistemleri yer alır. Dikkat katsayıları komşular arasında paralel hesaplandığı için GAT verimlidir ve farklı büyüklükteki komşuluklara doğal uyum sağlar. Üretilen dikkat ağırlıkları yorumlanabilir olduğundan hangi komşuların belirleyici olduğu analiz edilebilir. Türkiye'de ilaç keşfi ve biyoinformatik alanında çalışan araştırma grupları GAT mimarisini aktif olarak kullanmaktadır. GAT'ın 2021'de önerilen GATv2 varyantı, orijinal mimarideki statik dikkat hesabı sorununu gidererek her adımda tam dinamik dikkat üretir. PyTorch Geometric'in GATConv ve GATv2Conv katmanları, araştırmacılara hazır ve optimize edilmiş implementasyonlar sunar. Büyük çizgelerde ölçeklenebilirlik sorunu için mini-batch örnekleme ve Sparse GAT yaklaşımları yaygınlaşmaktadır; bu varyantlar yalnızca seyrek kenar kümeleriyle çalışarak bellek tüketimini önemli ölçüde azaltır.
Graph Neural Networks (Çizge Sinir Ağları)
Çizge Sinir Ağları (Graph Neural Networks, GNN), düğüm ve kenarlardan oluşan grafik yapılardaki ilişkileri ve örüntüleri öğrenmek için tasarlanmış derin öğrenme mimarilerinin genel adıdır. Geleneksel sinir ağları ızgara biçimindeki verilerde (görüntü, ses) güçlüdür; GNN'ler ise sosyal ağlar, moleküler yapılar, bilgi grafikleri ve öneri sistemleri gibi düzensiz, bağlantı merkezli verilerde çalışır. GNN'lerin temel işlemi **mesaj geçişidir (message passing)**: her düğüm, komşu düğümlerden bilgi toplayarak kendi temsilini (embedding'ini) günceller. Bu süreç birden fazla katmanda tekrarlanarak her düğümün giderek daha geniş bir komşuluk bölgesinden bilgi edinmesi sağlanır. Matematiksel olarak, bir düğümün yeni temsili; komşu düğümlerin önceki katman temsillerinin bir toplama (aggregation) fonksiyonundan geçirilmesiyle elde edilir. Yaygın GNN mimarileri farklı toplama stratejileri kullanır. **GCN (Graph Convolutional Network, Kipf & Welling 2017)**, spektral evrişimi basitleştirerek normalize edilmiş komşuluk toplamı kullanır. **GAT (Graph Attention Network)**, komşu düğümlere dikkat mekanizmasıyla farklı ağırlıklar atar. **GraphSAGE**, büyük grafikler için sürükleyici örnekleme tekniğiyle ölçeklenebilirlik sunar. **GIN (Graph Isomorphism Network)**, iki farklı grafiği ayırt etme gücünde Weisfeiler-Leman testine eşdeğer teorik güce ulaşır. GNN'lerin en çarpıcı uygulaması, DeepMind'ın **AlphaFold 2** modelidir; protein yapısı tahmininde aminoasitler arası mesafe ve açı ilişkilerini grafik olarak modelleyerek 50 yıllık biyolojik bir problemi çözdü. İlaç tasarımında moleküler grafik temsillerinden yeni ilaç adayları keşfedilmekte; sosyal ağlarda spam ve sahte hesap tespiti yapılmakta; e-ticarette kullanıcı-ürün grafikleri üzerinden kişiselleştirilmiş öneri sistemleri kurulmaktadır. Trafik tahmininde ise yol ağları grafik olarak modellenerek ulaşım akışı öngörülmektedir. GNN'lerin sınırları da mevcuttur: çok derin ağlarda aşırı yumuşama (over-smoothing) sorunu tüm düğüm temsillerini birbirine benzetebilir. Milyarlarca düğümden oluşan grafiklerde ölçeklenebilirlik hâlâ aktif araştırma alanıdır. Bunun yanı sıra bağlantı örüntüsüne dayalı önyargılar, sosyal ağ uygulamalarında etik kaygılara yol açabilir.
Grouped-Query Attention (Gruplu Sorgu Dikkati (GQA))
Grouped-Query Attention (GQA, Gruplu Sorgu Dikkati), transformer mimarisindeki dikkat mekanizmasını hem bellek hem de hesaplama açısından daha verimli hale getiren bir varyanttır. Yöntem 2023 yılında Google Research ekibinden Joshua Ainslie ve arkadaşları tarafından "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints" makalesiyle önerildi ve kısa sürede Llama 2 70B, Llama 3, Mistral 7B, Gemma 2 ve Qwen 2.5 gibi açık ağırlıklı modellerin ortak tercihi oldu. Klasik çok başlı dikkat (Multi-Head Attention, MHA) mimarisinde her sorgu (query) başı kendine ait bir anahtar-değer (key-value, K-V) çiftine sahiptir. Bu yapı en yüksek model kapasitesini sunar; ancak çıkarım sırasında üretilen her token için tüm K-V başlarının önbellekte tutulması gerekir ve uzun bağlamlarda GPU belleği hızla dolar. Multi-Query Attention (MQA) ise tüm sorgu başlarını tek bir K-V çiftiyle eşleştirir; bellek kullanımı çok düşer, fakat model kalitesinde ölçülebilir kayıp görülebilir ve eğitim kararsızlaşabilir. GQA bu iki uç arasında ayarlanabilir bir orta yol kurar. H adet sorgu başı G gruba bölünür ve her gruptaki başlar tek bir K-V çiftini paylaşır. KV önbelleğinin boyutu artık H ile değil G ile ölçeklenir; G = H olduğunda yapı MHA'ya, G = 1 olduğunda MQA'ya dönüşür. Llama 3 8B modeli 32 sorgu başını 8 K-V başıyla eşleştirir; bu yapılandırma MHA'ya kıyasla KV önbelleğini dört kat küçültür. 70B modelde 64 sorgu başı yine 8 K-V başını paylaşır ve tasarruf sekiz kata çıkar. Pratik sonuçları belirgindir: aynı GPU belleğiyle 128K token ve üzeri bağlam pencereleri işlenebilir, saniyede üretilen token sayısı artar ve çok kullanıcılı üretim ortamlarında daha büyük batch boyutları çalıştırılabilir. GQA, FlashAttention çekirdekleri ve RoPE konum kodlamasıyla doğrudan uyumludur; vLLM, TensorRT-LLM ve llama.cpp gibi çıkarım motorları bu yapıyı yerel olarak destekler. Ainslie ve arkadaşlarının deneyleri, MHA ile eğitilmiş bir modelin K-V başlarının ortalama havuzlama ile birleştirilip kısa bir ek eğitim (uptraining) uygulanarak, orijinal eğitim bütçesinin yaklaşık yüzde beşiyle GQA'ya dönüştürülebildiğini göstermiştir.
GRU (Gated Recurrent Unit) (GRU (Kapılı Tekrarlayan Birim))
GRU (Gated Recurrent Unit — Kapılı Tekrarlayan Birim), 2014 yılında Kyunghyun Cho ve ekibi tarafından önerilen, klasik Tekrarlayan Sinir Ağı (RNN) mimarisinin uzun vadeli bağımlılıkları öğrenmek için geliştirilmiş bir türevidir. Standart RNN'lerin temel sorunu olan kaybolan gradyan problemi (vanishing gradient), uzun dizilerde modelin erken adımlardaki bilgileri "unutmasına" yol açar. GRU bu sorunu, hangi bilgilerin saklanacağını ve hangilerinin atılacağını kontrol eden kapı (gate) mekanizmaları ile çözer. GRU, LSTM (Long Short-Term Memory) ile karşılaştırıldığında daha sade bir mimariye sahiptir. LSTM'de üç ayrı kapı (input, forget, output) ve ayrı bir hücre durumu (cell state) bulunurken, GRU yalnızca iki kapı kullanır: Güncelleme Kapısı (Update Gate) ve Sıfırlama Kapısı (Reset Gate). Bu sadeleştirme eğitim süresini ve bellek kullanımını önemli ölçüde azaltırken pek çok görevde LSTM ile kıyaslanabilir başarım elde edilmesini mümkün kılar. Güncelleme Kapısı (Update Gate), bir önceki gizli durumun (hidden state) ne kadarının yeni duruma aktarılacağını belirler. Bu kapı, geçmiş bilgilerin ne ölçüde korunacağını kontrol eder ve uzun vadeli bellek işlevi görür. Sıfırlama Kapısı (Reset Gate) ise geçmiş bağlamın ne kadarının yeni içeriği hesaplamak için kullanılacağını düzenler; geçmiş bilginin önemsiz olduğu durumlarda bu kapı kapatılarak gizli durum temizlenebilir. GRU, doğal dil işleme, konuşma tanıma, zaman serisi tahmini ve makine çevirisi gibi ardışık veri içeren görevlerde yaygın olarak kullanılır. Özellikle veri miktarının sınırlı olduğu veya hesaplama kapasitesinin kısıtlı olduğu durumlarda LSTM'ye kıyasla tercih edilir. Çift yönlü GRU (Bidirectional GRU) dizi bağlamını hem ileri hem geri yönde yakalayarak duygu analizi ve adlandırılmış varlık tanıma gibi görevlerde üstünlük sağlar. PyTorch'ta torch.nn.GRU, TensorFlow/Keras'ta ise tf.keras.layers.GRU sınıfıyla tek satır kodla kullanıma hazırdır. Hibrit Transformer-GRU mimarileri de araştırma literatüründe giderek daha fazla yer bulmaktadır.
Hebbian Learning (Hebbian Öğrenme (Hebb Kuralı))
Hebbian Learning, 1949 yılında Kanadalı nöropsikolog Donald Hebb'in "The Organization of Behavior" adlı eserinde öne sürdüğü sinaptik plastisite hipotezidir. Hebb'in önerisi, yapay sinir ağı öğrenmesinin en temel kuramsal çerçevesini oluşturur ve "birlikte ateşlenen nöronlar birbirine bağlanır" (neurons that fire together, wire together) şeklinde özetlenen ilkeye dayanır. Matematiksel formülasyonu basittir: Δw_ij = η × x_i × x_j. Bu eşitlikte Δw_ij, presinaptik nöron i ile postsinaptik nöron j arasındaki ağırlık değişimini; η öğrenme oranını; x_i presinaptik aktivasyonu ve x_j postsinaptik aktivasyonu temsil eder. İki nöron aynı anda aktif olduğunda aralarındaki sinaptik bağlantı güçlenir; biri aktif diğeri pasif olduğunda ise bağlantı zayıflar. Bu mekanizma, uzun dönemli potansiyasyon (LTP) olarak bilinen biyolojik fenomenin matematiksel soyutlamasıdır. Hebbian öğrenme, öğretmensiz (unsupervised) bir paradigmadır: dışarıdan sağlanan bir hata sinyaline ya da etiketli veriye ihtiyaç duymaz. Bu özellik onu modern geri yayılım (backpropagation) algoritmalarından köklü biçimde ayırır. Ne var ki temel Hebbian kuralının kritik bir zayıflığı vardır: ağırlıklar sınırsız büyüyebilir. Bu sorunu gidermek için çeşitli normalizasyon uzantıları geliştirilmiştir. Oja Kuralı, ağırlıkları normalize ederek ana bileşen analizi (PCA) ile eşdeğer bir öğrenmeye yönlendirir ve kararlı bir çözüme ulaşır. BCM Teorisi (Bienenstock-Cooper-Munro), görsel korteks plastisite modellemesinde kullanılan eşikli bir güncelleme kuralı sunar. STDP (Spike-Timing-Dependent Plasticity) ise nöronların ateşlenme zamanlamasına duyarlı, biyolojik gerçekliğe çok daha yakın bir Hebbian varyantıdır. Uygulama alanları arasında Hopfield ağları (çağrışımsal bellek), kısıtlı Boltzmann makineleri ve öz-örgütlenen haritalar (SOM) sayılabilir. Modern derin öğrenme mimarileri standart geri yayılımı benimsemiş olsa da Hebbian öğrenmenin ilkeleri nöromorfik çip tasarımı, yaşam boyu öğrenme (continual learning) ve biyolojik olarak mümkün yapay zeka araştırmalarında güncelliğini korumaktadır.
Hopfield Network (Hopfield Ağı)
Hopfield ağı, Nobel ödüllü fizikçi John Hopfield tarafından 1982 yılında önerilen ve çekici dinamikler (attractor dynamics) temelinde çalışan tekrarlayan sinir ağı mimarisidir. Biyolojik bellekten ilham alan bu model, enerji minimizasyonu prensibiyle bozulmuş ya da eksik girdi kalıplarını önceden depolanmış tam kalıplardan birine yakınsatabilir. Bu özellik onu içerik adreslenebilir bellek (content-addressable memory) sistemleri için doğal ve güçlü bir hesaplama çerçevesi haline getirir. Klasik Hopfield ağında nöronlar ikili durumlu (+1 veya -1) ve tam bağlantılıdır; her nöron diğer tüm nöronlarla bağlantı kurar, ancak kendisiyle bağlantı kurmaz. Ağırlık matrisi Hebian öğrenme kuralıyla belirlenir: her depolanmak istenen kalıp için dış çarpım (outer product) ağırlık matrisine eklenir. Sistemin enerji fonksiyonu E = -½ΣΣW_ij s_i s_j formülüyle ifade edilir. Asenkron güncelleme kuralı her adımda enerjiyi azaltır ve sistem sonunda yerel bir minimuma (çekim noktasına) yakınsar. N nöronlu klasik bir Hopfield ağı yaklaşık 0.14×N kalıp depolayabilir; bu kapasite sınırı aşıldığında depolanmamış sahte anılar (spurious memories) ortaya çıkabilir ve geri çağırma performansı bozulabilir. 2016 ve 2020 yıllarında Ramsauer ve diğerleri tarafından geliştirilen Modern Hopfield Ağları, depolama kapasitesini üstel düzeye taşımıştır. Daha da çarpıcı olan bulgu şudur: modern Hopfield ağının tek adım güncelleme kuralı, Transformer mimarisindeki softmax dikkat (attention) mekanizmasıyla matematiksel olarak tam anlamıyla eşdeğerdir. Bu keşif Hopfield ağlarını teorik açıdan yeniden güncel kılmış ve derin öğrenme yorumlanabilirliği araştırmalarına yeni bir boyut katmıştır. Hopfield ağları biyolojik sinirsel süreçlerin modellenmesi, kombinatoryal optimizasyon (gezgin satıcı problemi gibi), protein işlev sınıflandırması ve immünolojik veri analizi gibi alanlarda uygulanmaktadır. John Hopfield, bu katkıları nedeniyle Geoffrey Hinton ile birlikte 2024 Nobel Fizik ödülüne layık görülmüştür.
Hypernetwork (Hiper Ağ)
Hypernetwork, başka bir sinir ağının (ana ağın) ağırlıklarını dinamik olarak üreten küçük bir yardımcı sinir ağıdır. 2016 yılında David Ha, Andrew Dai ve Quoc Le tarafından önerilen ve ICLR 2017 konferansında yayımlanan bu mimari, geleneksel derin öğrenmede sabit tutulan model parametrelerini koşullamaya duyarlı biçimde üretmeyi mümkün kılar. Klasik derin öğrenmede her katmanın ağırlıkları geri yayılım (backpropagation) ile öğrenilir ve eğitim tamamlandığında değişmez hale gelir. Hypernetwork yaklaşımında iki bileşenli bir yapı kullanılır: küçük hiper ağ, bir koşullama girdisi (görev kimliği, stil vektörü, gizli durum vb.) alarak ana ağın belirli katmanlarına ait ağırlık matrislerini hesaplar. Ana ağ bu ağırlıkları doğrudan kullanır; farklı koşullamalar için farklı parametre setleri anında elde edilir. Eğitim sırasında her iki ağ da aynı anda optimize edilir ve gradyanlar hem ana ağın kayıp fonksiyonundan hem de hiper ağ çıktısından hesaplanır. Bu mimari, çok sayıda görevi tek bir model çatısı altında toplamaya imkân tanır. Hiper ağ farklı koşullamalar için parametreler ürettiğinden milyonlarca parametreyi ayrı ayrı ezberlemek yerine üretme yolu tercih edilir; bu da parametre verimliliğini önemli ölçüde artırır. Modern derin öğrenmede hypernetwork kavramı, LoRA (Low-Rank Adaptation) gibi parametre etkin ince ayar teknikleriyle kavramsal açıdan yakın ilişkidedir. LoRA'nın delta ağırlıklarını düşük ranklı çarpanlara ayırması, bir hypernetwork'ün kompakt bir gizli vektörden ağırlık üretmesiyle örtüşen bir yaklaşımdır. Nöral mimari arama (NAS) uygulamalarında hiper ağ, farklı mimari konfigürasyonların ağırlıklarını paylaşarak büyük arama uzaylarını hızla değerlendirmeye yarar. 2023 yılından itibaren çok modlu (multimodal) sistemlerde de kullanım alanı genişleyen hypernetwork mimarisi, görüntü koşullamasıyla metin üreticinin parametre davranışının anlık olarak değiştirilebildiği modellerin temelini oluşturmaktadır. Bu yapı; meta-öğrenme, federe öğrenme ve sürekli öğrenme alanlarında güçlü sonuçlar vermektedir. Özellikle birden fazla görevi tek bir model mimarisinde yönetmek, hızlı adaptasyon ve görevler arası bilgi paylaşımı gerektiren uygulamalarda hypernetwork yaklaşımı araştırmacılar tarafından değerli bir araç olarak görülmektedir.
Kapsül Ağı (Kapsül Ağı Nedir? Uzaysal Hiyerarşiyi Koruyan Sinir Ağı Mimarisi)
Kapsul agi (capsule network), geleneksel Evrisimsel Sinir Aglarindaki (CNN) skaler aktivasyon birimlerinin yerine "kapsul" adli vektor birimleri kullanan bir derin ogrenme mimarisidir. Her kapsul, yalnizca bir ozelligi tespitini degil o ozelligi ile ilgili yonelim, boyut ve konum gibi pose bilgisi iceren bir vektor ciktisi uretir. Bu temel fark kapsul aglarini geleneksel CNN'lerden ayrilan ve uzamsal hiyerarsiyi daha eksiksiz modellemelerini saglayan bir yapi kilar. Bu fikrin mimari babasi Geoffrey Hinton'dur; kapsul aglarinin temelini yıllarca oncesinden atmış olsa da 2017 yilındaki "Dynamic Routing Between Capsules" (Sabour, Frosst, Hinton) makalesi modern kapsul agi arastirmasinin baslangic noktasi sayilmaktadir. Geleneksel CNN'lerin max pooling katmani, bir nesnenin bir bolumde olup olmadigını algılar ama nerede oldugunu veya nasil yonlendirildigini atar. Hinton bu yaklasimi insan beyninin parcalar arasindaki iliskiyi anlamadaki becerisini modelleyemedigini one surmuş; kapsullerin bu eksikligi gidereceğini savunmustur. Dynamic routing, kapsul aglarinin merkezi hesaplama mekanizmasidur. Her alt kapsul, ust kapsullar icin potansiyel katkiyi tahmin eder ve bu katkinin ust kapsulun fiili ciktisiyla ne kadar uyuştuğuna bakarak baglantiyi iteratif sekilde gunceller. Anlasma (agreement) yuksekse baglanti guclenir; dusukse zayiflar. Bu dongusal islem, max pooling'in yaptigi basit maksimum alma yerine anlamli uzamsal iliskileri kodlar. Kapsul aglarinin pratik sinirliliklari da mevcuttur. MNIST gibi kucuk ve temiz veri kumelerinde umut verici sonuclar gosterirken ImageNet gibi buyuk olcekli karmasik veri kumelerinde standart CNN'lerle rekabet etmek hem hesaplama maliyeti hem dogruluk acisindan zordir. Alanin hala aktif arastirma konu olmakla birlikte ana akım uretim sistemlerinde standart CNN ve Transformer mimarisi hakimiyetini korumaktadir. **Sik Sorulan Sorular** **Kapsul aglari neden ana akima giremedi?** Buyuk olcekli veri kumelerinde standart CNN'lerle rekabet edemez; dynamic routing hesaplama maliyeti ve olcekleme guclugu ana akım benimsenmemesinin baslica nedenidir. **Kapsul aglari Transformer'larla karsilastirılabilir mi?** Her iki mimari de uzamsal iliskiler modelleme acisindan geleneksel CNN'den farkli; ancak farkli mekanizmaları kullanmaktadır. Transformer'larin buyuk olcekli veride basarisi, kapsul aglarinin araştirma etkisini kısmen golgede birakmiştir. **Kapsul aglari goruntu disinda kullanilabilir mi?** Prensipte evet; noktabultaji ve ses gibi alanlarda denemeler yapilmistir. Ancak buyuk olcekli goruntulerle bile zorlanan mimari, diger modalitelerde az incelenmiştir. **Kapsul aglari gunumuzde kullanılıyor mu?** Arastirma laboratuvarlarinda aktif calismalar surdurulmekte; ancak uretim sistemlerinde neredeyse hi kullanimazdir. Vision Transformer (ViT) ve benzeri mimariler buyuk olcekli gorsel algida hakimiyeti ele gecirmistir.
Layer Normalization (Katman Normalizasyonu)
Layer Normalization (Katman Normalizasyonu), derin öğrenme modellerinde eğitimi hızlandırmak ve kararlılaştırmak için kullanılan bir normalizasyon yöntemidir. Jimmy Ba ve Geoffrey Hinton tarafından 2016 yılında önerilen bu teknik, her bir veri örneğinin aktivasyonlarını özellik boyutu (feature dimension) üzerinden normalleştirir; bu sayede batch boyutundan tamamen bağımsız biçimde çalışır. Yöntemin matematiksel temeli şudur: bir katmandaki H adet nöronun aktivasyonları için μ (ortalama) ve σ (standart sapma) hesaplanır, ardından her aktivasyon normalize edilir ve öğrenilebilir parametreler γ (gain) ile β (bias) ile yeniden ölçeklenir. Formül: ŷ = γ × (x − μ) / √(σ² + ε) + β. Burada ε sıfıra bölmeyi önleyen küçük bir sabittir. Batch Normalization (BN) mini-batch içindeki tüm örneklere bakarak istatistik hesaplarken, Layer Normalization yalnızca tek örneğin kendi özellik boyutuna bakar. Bu fark, BN'nin değişken uzunluklu dizilerle ve batch size=1 senaryolarında yetersiz kalmasına yol açar; LN bu sınırlamaları aşar ve Tekrarlayan Sinir Ağları (RNN) ile Transformer mimarileri için doğal seçim haline gelir. Modern büyük dil modellerinde iki yerleşim biçimi bulunur. Orijinal Transformer (Vaswani ve ark., 2017) her alt katmanın (dikkat + FFN) çıktısından sonra LN uygular; buna Post-LN denir. GPT-3, LLaMA ve çoğu modern LLM ise her alt katmanın girişine LN uygular (Pre-LN). Pre-LN, gradyan akışını daha kararlı kılar ve genellikle daha kolay eğitilir. RMSNorm, Layer Norm'un hesaplama maliyetini azaltmak için önerilmiş bir varyantıdır. Ortalama çıkarma (mean subtraction) adımını atlayarak yalnızca karekök ortalama karesiyle (RMS) normalleştirir. LLaMA 2/3 ve Mistral gibi modeller RMSNorm'u tercih eder çünkü GPT düzeyinde kaliteyi daha az işlemle elde eder. Layer Normalization, eğitim sırasında model aktivasyonlarını ölçek ve kayma bağımsız hale getirerek öğrenme hızı seçimini daha az kritik kılar ve farklı boyutlardaki modeller arasında transferi kolaylaştırır.
Liquid Neural Network (Sıvı Sinir Ağları)
Liquid Neural Network (Sıvı Sinir Ağı), MIT CSAIL'den Ramin Hasani ve Mathias Lechner liderliğindeki ekibin 2020 yılında yayımladığı, zamanla değişen dinamik ağırlıklarla çalışan bir sinir ağı mimarisidir. "Sıvı" metaforu, ağırlıkların eğitim tamamlandığında dondurulması yerine her yeni girdi ile birlikte akışkan biçimde uyum sağlamasına gönderme yapar; bu durum modeli, özellikle zaman boyutu kritik olan görevler için doğası gereği elverişli kılar. Mimarinin çıkış noktası, yalnızca 302 nörona ve yaklaşık 7.000 sinapsa sahip C. elegans adlı nematod solucanının sinir sistemidir. Bu minimalist yapı; koku takibi, ışık hassasiyeti ve karmaşık sensorimotör davranışlar gibi işlevleri başarıyla yönetebilmektedir. MIT ekibi bu organizmanın nöral devrelerini matematiksel olarak modelleyerek Liquid Time-Constant (LTC) adı verilen temel yapı taşını geliştirdi. Teknik açıdan LTC hücresi, zaman sabitinin (τ) girdiye bağlı olarak değiştiği sürekli zamanlı diferansiyel denklem üzerine kurulur: dx/dt = -x/τ(x,I) + f(x,I). Bu denklem her zaman adımında Euler veya Runge-Kutta gibi ODE çözücüleriyle nümerik olarak ilerletilir. Klasik LSTM veya GRU ağlarının aksine, her girdi hücrenin iç dinamiğini geçici olarak etkiler; bu nedenle ağ statik değil, sürekli değişen bir temsil yapısı sunar. Pratik açıdan mimari, otonom araç sterzo kontrolünde standart LSTM'den %26 daha iyi genelleme sağladığı gösterilmiştir. Daha az parametreyle aynı temsil kapasitesine ulaşılması, düşük kaynaklı kenar cihazlarda (MCU, IoT) gerçek zamanlı çıkarım için önemli bir avantaj yaratır. Gürültülü veya eksik veri koşullarında sergilediği gürbüzlük, endüstriyel sensör izleme ve tıbbi sinyal analizi (EEG, EKG) gibi kritik alanlarda tercih nedeni olmaktadır. Eğitim sürecindeki temel zorluk, ODE çözücü adımlarının paralel GPU hesaplamasını güçleştirmesidir. Bu sınırlamayı aşmak için 2022'de Closed-Form Continuous-Time (CfC) mimarisi tanıtıldı; ODE yerine kapalı analitik form kullanarak eğitim süresini belirgin biçimde kısalttı. Ekibin 2023'te kurduğu Liquid AI şirketi bu temeli endüstriyel ölçeğe taşıyan modeller geliştirmektedir.
Mixture of Experts Routing (MoE Yönlendirme)
Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. 2017 yılında Shazeer ve arkadaşları tarafından "Outrageously Large Neural Networks" makalesiyle transformer mimarisine entegre edilen bu yaklaşım, GPT-4, Mixtral, DeepSeek ve Gemini gibi önde gelen modellerin temel mimarisi hâline gelmiştir. Geleneksel dense transformer mimarilerinde her token, modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar; ardından en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez. Böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur; bu özellik MoE'yi "sparse" (seyrek) mimari olarak da tanımlar. MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu sorunu önlemek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir. DeepSeek-V3, bu sorunu ek kayıp yerine dinamik bias ayarıyla çözen farklı bir yaklaşım benimsemiştir. Routing iki ana paradigmada gerçekleşir. Token-Choice routing'de her token hangi uzmanı tercih ettiğini seçer; Expert-Choice routing'de ise her uzman belirli tokenleri kendisi alır. İkinci yöntem doğal yük dengesi barındırmakla birlikte bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini beraberinde getirir. 2024-2025 döneminde MoE mimarisi çarpıcı verimlilik göstermiştir: Mixtral 8x7B, 8 uzmanı arasından 2'sini seçerek yaklaşık 47B toplam parametreyle yalnızca 13B aktif parametre kullanır. DeepSeek-V3 ise 256 uzman arasından 8'ini aktive ederek eğitim maliyetini belirgin biçimde azaltmış ve rekabetçi performans elde etmiştir. Bu nedenle MoE, ölçeklenebilir yapay zeka araştırmalarının temel odak noktalarından biri olmayı sürdürmektedir.
MLP (Çok Katmanlı Algılayıcı)
MLP (Multilayer Perceptron — Çok Katmanlı Algılayıcı), en az bir gizli katman içeren ileri beslemeli (feedforward) yapay sinir ağıdır. 1958'de Frank Rosenblatt tarafından tasarlanan tek katmanlı algılayıcı yalnızca doğrusal ayrılabilir verileri sınıflandırabilirken, gizli katmanların eklenmesiyle MLP; XOR problemi dahil karmaşık, doğrusal olmayan örüntüleri öğrenme kapasitesi kazandı. MLP üç ana bileşenden oluşur. Giriş katmanı ham veriyi ağa iletir; herhangi bir hesaplama yapmaz. Bir veya daha fazla gizli katman, önceki katmanın tüm nöronlarına tam bağlı (fully connected) nöronlar barındırır ve gerçek öğrenme burada gerçekleşir. Çıkış katmanı ise sınıflandırma problemlerinde sınıf sayısı kadar, regresyon problemlerinde genellikle tek nöronlu sonuç üretir. Her nöron şu işlemi uygular: girdilerin ağırlıklı toplamını hesaplar, bir sapma (bias) değeri ekler ve doğrusal olmayan bir aktivasyon fonksiyonundan (ReLU, Sigmoid ya da Tanh) geçirir. Doğrusal olmayan aktivasyon olmadan çok katmanlı bir ağ, matematiksel olarak tek katmanlı bir ağa indirgenirdi ve karmaşık örüntüleri öğrenemezdi. MLP'yi pratik hale getiren atılım, Rumelhart, Hinton ve Williams'ın 1986'da Nature dergisinde yayımladığı geri yayılım (backpropagation) algoritmasıdır. Algoritma, çıkış hatasını zincir kuralıyla katman katman geri yayarak her ağırlığın kayba olan katkısını hesaplar; ardından optimizör (genellikle SGD veya Adam) bu gradyanlarla ağırlıkları günceller. Bu döngü on binlerce kez tekrarlanarak model adım adım öğrenir. Evrişimsel Sinir Ağları (CNN) paylaşımlı ağırlıklarla görüntü verisini çok daha verimli işlerken, MLP'nin tam bağlantılı yapısı uzamsal ilişkileri doğal olarak yakalayamaz. Tekrarlayan Sinir Ağları (RNN) metin ve zaman serisi gibi ardışık veriler için gizli bir durum taşırken, MLP sabit boyutlu girdi üzerinde çalışır. 2021'de Google Brain'in tanıttığı MLP-Mixer mimarisi, öz-dikkat (self-attention) mekanizması yerine yalnızca MLP katmanlarıyla Vision Transformer'larla rekabetçi görüntü sınıflandırma sonuçları elde etti. Bu, doğru tasarımla saf MLP'lerin de güçlü görevler üstlenebileceğini kanıtladı. Günümüzde tablo verisi, özellik çıkarımı sonrası sınıflandırma ve büyük modellerin dahili bileşeni olarak MLP aktif kullanımını sürdürmektedir.
Multi-Head Attention (Çok Başlı Dikkat Mekanizması)
Çok başlı dikkat mekanizması (Multi-Head Attention), transformer modellerinin giriş dizisine aynı anda birden fazla farklı bakış açısından odaklanmasını sağlayan temel bir sinir ağı bileşenidir. 2017 yılında Google'ın "Attention is All You Need" makalesiyle tanıtılan bu mekanizma, modern büyük dil modellerinin (LLM) temel yapı taşını oluşturur. Klasik tek başlı dikkat mekanizması, bir cümledeki her token için yalnızca tek bir ilişki türünü yakalayabilirken, çok başlı dikkat h adet bağımsız "dikkat kafasını" paralel olarak çalıştırır. Her kafa, giriş gömme vektörünü üç farklı matrise dönüştürür: Sorgu (Q), Anahtar (K) ve Değer (V). Sorgu vektörü "ne arıyorum?" sorusunu, Anahtar vektörü "ne sunuyorum?" sorusunu, Değer vektörü ise "ilgili bilgi nedir?" sorusunu temsil eder. Her kafanın dikkat skoru, ölçeklenmiş nokta çarpımı formülüyle hesaplanır: softmax(QKᵀ / √d_k) × V. Buradaki √d_k ölçekleme faktörü, büyük iç çarpımların softmax'ı aşırı keskinleştirip gradyanların sıfıra yaklaşmasını önler. Her kafa, toplam model boyutunun (d_model) h'e bölünmesiyle elde edilen daha küçük bir alt uzayda çalışır; böylece toplam hesaplama maliyeti tek başlı dikkatle karşılaştırılabilir düzeyde kalır. Farklı kafalar farklı ilişki türlerini öğrenir: bir kafa sözdizimsel yapıyı, bir diğeri anlamsal benzerlikleri, bir üçüncüsü uzun menzilli bağımlılıkları yakalayabilir. Tüm kafalara ait çıktılar birleştirilerek tek bir doğrusal dönüşümden geçirilir ve modelin zengin, çok boyutlu bir bağlam temsili oluşturması sağlanır. Gerçek dünya modellerinde kafa sayısı büyük farklılıklar gösterir: BERT-Base her katmanda 12, GPT-3 ise 96 kafa kullanır. Araştırmalar, bazı kafaların eğitim sırasında belirli dilsel işlevlere uzmanlaştığını göstermektedir. Vision Transformer (ViT) gibi görsel modeller de aynı mekanizmayı görüntü yamalarına uygulayarak mekânsal ilişkileri öğrenir. GPT, LLaMA, Mistral, Gemma ve Claude gibi tüm modern modeller bu temel mekanizmaya dayanır.
Neural Network (Yapay Sinir Ağı)
Yapay sinir ağı (İngilizce: neural network, kısaltma: ANN — Artificial Neural Network), insan beynindeki biyolojik nöronların birbirleriyle bilgi alışverişi yapma biçiminden ilham alınarak tasarlanmış bir makine öğrenimi modelidir. Veriler, ağın içinde birbirine bağlı yapay nöronlar (düğümler) üzerinden geçerken ağırlıklı toplamlar ve aktivasyon fonksiyonları gibi matematiksel işlemlere tabi tutulur; ağ, eğitim boyunca bu ağırlıkları güncelleyerek verideki örüntüleri kendi kendine öğrenir. Bu mimari, derin öğrenmenin (deep learning) yapıtaşıdır. Görüntü tanımadan ses sentezine, makine çevirisinden ChatGPT gibi büyük dil modellerine kadar modern yapay zekanın neredeyse tüm yetenekleri sinir ağlarına dayanır. ANN'in geleneksel programlamadan temel farkı, kuralların insan tarafından yazılmaması, örneklerden türetilmesidir. Klasik bir algoritmada "kediyi tanıma" kuralını satır satır kodlamanız gerekirken, bir sinir ağına binlerce kedi fotoğrafı gösterirsiniz; ağ, kenar, doku ve şekil gibi özellikleri katman katman kendisi keşfeder. Bu yaklaşım, elle kural yazmanın pratikte imkânsız olduğu karmaşık problemlerde (yüz tanıma, konuşma anlama, protein yapısı tahmini) sinir ağlarını vazgeçilmez kılar. Standart bir ANN üç ana katman tipinden oluşur: verinin modele girdiği Girdi Katmanı, karmaşık hesaplamaların gerçekleştirildiği bir veya daha fazla Gizli Katman ve tahminin üretildiği Çıktı Katmanı. Katmanlar arası bağlantıların yoğunluğu ile derinliği, modelin öğrenebileceği örüntülerin karmaşıklığını doğrudan belirler. Öğrenme mekanizması geri yayılım (backpropagation) algoritmasına dayanır: tahmin ile gerçek değer arasındaki hata, zincir kuralıyla geriye doğru yayılarak tüm ağırlıklar güncellenir. Pratikte üç mimari ailesi öne çıkar: görüntü işleyen CNN'ler, sıralı verileri modelleyen RNN'ler ve günümüz dil modellerinin temeli olan Transformer'lar. Kavramın kökü 1943'teki McCulloch-Pitts nöron modeline ve 1958'deki Perceptron'a kadar uzanır; büyük veri ile GPU gücünün buluştuğu 2010'lu yıllarda derin sinir ağları alanın merkezine yerleşti ve o günden bu yana yapay zekadaki ilerlemenin temel motoru olmayı sürdürmektedir. PyTorch, TensorFlow ve JAX bu modellerin geliştirildiği başlıca çerçevelerdir.
Neural ODE (Nöral Adi Diferansiyel Denklem)
Neural ODE (Nöral Adi Diferansiyel Denklem), derin öğrenme modellerindeki gizli durumun (hidden state) değişimini ayrık katman geçişleri yerine sürekli bir diferansiyel denklemle tanımlayan yapay sinir ağı mimarisidir. Geleneksel derin ağlarda gizli durum h_{l+1} = h_l + f(h_l) biçiminde ayrık adımlarla güncellenir — bu yapı, Euler yöntemiyle çözülen bir ODE'nin ayrık yaklaşımına karşılık gelir. Neural ODE ise bu ayrık yapıyı dh/dt = f(h(t), t, θ) denklemiyle süreklilik boyutuna taşır ve çıkışı bir ODE çözücüsü (örn. Dormand–Prince, Runge-Kutta) yardımıyla hesaplar. 2018 NeurIPS konferansında Ricky T. Q. Chen, Yulia Rubanova, Jesse Bettencourt ve David Duvenaud tarafından tanıtılan bu mimari üç temel avantaj sunar. Birincisi bellek verimliliğidir: geri yayılım için adjoint (eşlenik) yöntemi kullanılır, bellek maliyeti katman sayısından bağımsız O(1) olarak kalır; geleneksel geri yayılımda bu maliyet katman sayısıyla doğrusal büyür. İkincisi uyarlanabilir derinliktir: ODE çözücüsü hata toleransına göre gereken kadar fonksiyon değerlendirmesi yapar, basit girdiler için daha az, karmaşık dinamikler için daha fazla hesaplama harcar. Üçüncüsü düzensiz örneklenmiş veriler için doğal uyumluluktur: klasik LSTM ve GRU gibi modeller eşit zaman aralığı varsayımına dayanırken Neural ODE herhangi bir t değerinde çözüme erişebildiğinden tıbbi sensör verisi, finans ve astrofizik gibi alanlarda doğrudan uygulanabilir. Öne çıkan varyantlar arasında hastalık ilerlemesini modelleyen Latent ODE ve yüksek boyutlu yoğunluk tahmini için ODE çerçevesini kullanan Sürekli Normalleştirici Akışlar (CNF) sayılabilir. Temel pratik kısıt, ODE çözücünün her ileri geçişte birden fazla ağ değerlendirmesi gerektirmesi ve sert (stiff) diferansiyel denklemlerin çözücü adımını büyük ölçüde artırabilmesidir. Bu nedenle hız öncelikli sistemlerde hâlâ ResNet ve Transformer mimarileri tercih edilmekte; Neural ODE ise fizik bilgili öğrenme, robotik ve biyomedikal veri analizi gibi niş ama önemli alanlarda güçlü bir araç olarak konumlanmaktadır.
Parameters (Parametreler)
Parametreler (parameters), makine öğrenmesi ve derin öğrenme modellerinde eğitim süreci boyunca optimizasyon algoritmaları tarafından güncellenen öğrenilebilir değerlerdir. Sinir ağlarında ağırlıklar (weights) ve biaslar (biases) en temel parametre türleridir; bu değerler, modelin girdiden çıktıya olan dönüşümü nasıl gerçekleştireceğini belirler. Model parametrelerinin sayısı, bir modelin kapasitesini ve ifade gücünü doğrudan etkiler. GPT-2 yaklaşık 117 milyon, GPT-3 ise 175 milyar parametreden oluşur; bu fark, modellerin dil anlama ve üretme kapasitelerindeki büyük uçurumu açıklar. Ancak parametre sayısı tek başına performansı garanti etmez; veri kalitesi, mimari tasarım ve eğitim stratejisi de kritik rol oynar. Parametreler, hiperparametrelerden farklıdır. Hiperparametreler (öğrenme hızı, batch boyutu, katman sayısı) eğitim öncesinde tasarımcı tarafından belirlenir ve eğitim sürecinde değişmez. Parametreler ise geri yayılım (backpropagation) algoritmasıyla her eğitim adımında güncellenir. Model büyüklüğünü ölçmek için kullanılan parametre sayısı, hesaplama maliyetini ve bellek gereksinimini de doğrudan etkiler. 7 milyar parametreli bir modelin tam hassasiyetle (FP32) yüklenmesi yaklaşık 28 GB bellek gerektirir; kuantizasyon teknikleri (INT8, INT4) büyük modelleri tüketici donanımında kullanılabilir kılmak için kritik önem taşır. Aktivasyon fonksiyonları, katman normalizasyonları ve dikkat mekanizmalarının ağırlıkları da birer parametredir. Transformer mimarilerinde dikkat başlıklarının sorgu, anahtar ve değer matrislerindeki ağırlıklar, modelin hangi bağlamsal bilgilere odaklanacağını öğrenir. Fine-tuning sırasında yalnızca belirli katmanların parametrelerini güncellemek (LoRA, prefix tuning gibi PEFT yöntemleri) hesaplama maliyetini dramatik biçimde düşürebilir; bu yaklaşımda modelin geri kalan parametreleri dondurulur (frozen) ve yalnızca küçük bir adaptasyon matrisi eğitilir. Parametre paylaşımı (parameter sharing), özellikle evrişimli sinir ağlarında (CNN) hafıza kullanımını azaltmak için başvurulan bir tekniktir; aynı filtre ağırlıkları görüntünün farklı bölgelerinde uygulanır. Mixture-of-Experts (MoE) mimarilerinde toplam parametre sayısı çok büyük olsa da her çıkarım adımında yalnızca küçük bir alt küme (uzman) aktif hâle gelir; bu yaklaşım hesaplama verimliliğini artırır. Örneğin Mixtral 8x7B modeli 46 milyar toplam parametreye sahip olsa da aktif parametre sayısı yalnızca 12 milyardır.
Pooling (Havuzlama Katmanı)
Havuzlama (Pooling) katmanı, evrişimli sinir ağlarının (CNN) temel bileşenlerinden biridir; özellik haritalarının uzamsal boyutlarını sistematik biçimde küçülterek en önemli bilgilerin yoğunlaştırılmasını sağlar. Evrişim katmanlarından elde edilen yüksek boyutlu aktivasyon haritaları, belirli bir pencere (kernel) içindeki değerleri tek bir değere özetleyerek daha küçük bir temsile dönüştürülür. En yaygın kullanılan türü maksimum havuzlama (max pooling) dur. Bu yöntemde belirlenen pencere (genellikle 2×2) içindeki en yüksek değer alınır ve özellik haritasının boyutu küçültülür. Max pooling, keskin ve belirgin özellikleri ön plana çıkarır; nesne tanıma ve sınıflandırma görevlerinde uygulamaların yaklaşık yüzde 80-90 ında bu yöntem tercih edilir. Ortalama havuzlama (average pooling) ise penceredeki tüm değerlerin ortalamasını alarak daha yumuşak bir temsil oluşturur. Gürültüye karşı daha dirençli olmakla birlikte bazen belirgin özellikleri zayıflatabilir. Küresel ortalama havuzlama (Global Average Pooling, GAP), tüm özellik haritasını tek bir değere indirgeyen modern bir yaklaşımdır. Tam bağlantılı katmanların yerini alabilmesi, parametre sayısını dramatik biçimde azaltır. VGG mimarisinin 138 milyon parametresi ResNet te 25 milyona inmiş olup bu farkın büyük bölümü GAP kullanımından kaynaklanmaktadır. MobileNet ve EfficientNet gibi hafif mimarilerde GAP artık standart bir seçenek hâline gelmiştir. Havuzlama katmanları öğrenilemeyen işlemlerdir; hiçbir ağırlık içermez. Geri yayılım sırasında max pooling yalnızca maksimum değerin bulunduğu konuma gradyanı iletirken diğer konumlara sıfır aktarır (switch mekanizması). Average pooling ise gradyanı penceredeki tüm konumlara eşit biçimde dağıtır. Havuzlamanın kritik bir katkısı translasyon değişmezliği (translation invariance) dir: bir nesne görüntüde birkaç piksel kaymış olsa bile max pooling, bölgenin en güçlü aktivasyonunu yakaladığından benzer sonuçlar üretebilir. Tarihsel olarak AlexNet (2012) ve VGG (2014) gibi öncü mimariler havuzlamaya yoğun biçimde başvurmuştur. Günümüzde adımlı evrişim (strided convolution) ve dilate evrişim gibi öğrenilebilir alternatifler önem kazanmış; Vision Transformer (ViT) gibi dikkat tabanlı modeller ise uzamsal alt örnekleme için dikkat mekanizmalarını tercih etmiştir. Buna karşın, evrişimli tabanlı ve gömülü sistem uygulamalarında havuzlama vazgeçilmez bir bileşen olmayı sürdürmektedir.
Positional Encoding (Konum Kodlama (Positional Encoding))
Konum Kodlama (Positional Encoding), Transformer mimarisinin temel bileşenlerinden biridir. Geleneksel Tekrarlayan Sinir Ağları (RNN) ve LSTM modelleri token'ları sırayla işleyerek doğal olarak konum bilgisini korur; Transformer modelleri ise tüm token'ları aynı anda paralel biçimde işler. Bu yaklaşım hesapsal açıdan büyük bir avantaj sunarken, modelin dizideki sıra bilgisini doğrudan elde edememesi anlamına gelir. Konum kodlama bu sorunu çözer: her token'ın öğrenilmiş embedding vektörüne, o token'ın dizideki konumunu temsil eden sayısal bir vektör eklenir. Örneğin "Kedi fareyi kovaladı" cümlesinde "kedi" kelimesi 1. konumda, "fareyi" 2. konumda yer alır; bu iki konumun farklı konum vektörleri sayesinde model sözcüklerin sıralamasını anlayabilir. Sinüzoidal Konum Kodlama, orijinal "Attention Is All You Need" makalesinde (Vaswani ve diğerleri, 2017) kullanılmış yöntemdir. Bu yaklaşımda her konum için sinüs ve kosinüs fonksiyonları hesaplanır: PE(pos, 2i) = sin(pos / 10000^(2i/d)) ve PE(pos, 2i+1) = cos(pos / 10000^(2i/d)). Farklı frekanstaki dalgalar sayesinde her konum benzersiz bir imzaya sahip olur; bu vektörler öğrenilmez, eğitim sırasında sabit kalır. BERT ve GPT-2 gibi modeller, konum bilgisini eğitim sırasında veri üzerinden öğrenir. Bu öğrenilmiş konum gömmeleri daha esnek bir yapı sunmakla birlikte eğitimde görülmemiş dizi uzunluklarına genelleme yapmakta zorlanabilir. RoPE (Rotary Position Embedding), LLaMA, Mistral, Gemma ve Qwen ailesi gibi modern dil modellerinin büyük çoğunluğunun tercih ettiği bir yöntemdir. RoPE, konum bilgisini döndürme matrisleri aracılığıyla dikkat mekanizmasına doğrudan entegre eder. Hem mutlak hem göreli konum bilgisini etkin biçimde kodlar; uzun bağlam uzunluklarına genelleme konusunda önceki yöntemlere kıyasla belirgin üstünlük gösterir. ALiBi (Attention with Linear Biases) ise dikkat puanlarına konum farkına dayalı doğrusal bir ceza ekler. Bu tasarım, modeli eğitimde hiç görmediği dizi uzunluklarına genellemeye yardımcı olur ve bellek açısından verimli bir çözüm sunar. Konum kodlamasının seçimi modelin bağlam penceresi boyutunu, çok dilli performansını ve hesapsal verimini doğrudan etkiler. Bu nedenle büyük dil modeli araştırmalarında, özellikle uzun bağlam penceresi geliştirme çalışmalarında, aktif olarak araştırılan bir alan olmayı sürdürmektedir.
Pruning (Sinir Ağı Budaması)
Sinir ağı budaması (neural network pruning), büyük ve karmaşık derin öğrenme modellerini daha küçük, hızlı ve verimli hale getirmek amacıyla modeldeki gereksiz ya da önemsiz parametreleri kaldıran bir model sıkıştırma yöntemidir. Bir insan beyninin yeni bağlantılar kurarken kullanılmayan sinaptik bağlantıları budadığı bilinmektedir; benzer bir ilkeden esinlenen bu teknik, yapay sinir ağlarına da uygulanır. Budama, çoğunlukla model eğitiminin ardından gerçekleştirilir; ancak eğitim sırasında veya eğitim öncesinde de uygulanabilen yöntemler araştırılmaktadır. Temel amacı, modelin doğruluk oranını kabul edilebilir düzeyde koruyarak parametre sayısını, bellek kullanımını ve hesaplama maliyetini önemli ölçüde düşürmektir. Budama teknikleri iki ana kategoriye ayrılır. Yapılandırılmamış budama (unstructured pruning), ağırlık matrisindeki bireysel bağlantıları kaldırır; seyrek matris yapısı oluşturur ancak standart donanımda gerçek hız kazanımı için özel kütüphane veya donanım desteği gerektirir. Yapılandırılmış budama (structured pruning) ise tüm filtreler, kanallar veya katmanlar gibi bütüncül yapıları bir bütün olarak siler; standart GPU ve CPU'larda doğrudan çıkarım hızı artışı ve model küçülmesi elde edilir. En yaygın yöntem büyüklük tabanlı budamadır (magnitude-based pruning): mutlak değeri en küçük ağırlıklar, modelin öğrendiği bilgiye katkısı az kabul edilerek kaldırılır. Ardından model, performansını yeniden kazanması için ince ayar (fine-tuning) sürecinden geçirilir. Bu "eğit → buda → ince ayar" döngüsü, hedef boyut ve doğruluk değerlerine ulaşılana kadar birkaç kez tekrarlanabilir. 2018'de Frankle ve Carlin tarafından öne sürülen Piyango Bileti Hipotezi (Lottery Ticket Hypothesis), büyük sinir ağlarının başlangıçtan beri eğitilebilir nitelikte küçük alt ağlar — "kazanan biletler" — barındırdığını ileri sürer. Bu alt ağlar, tam ağın yüzde 10 ile 20'si büyüklüğünde olmasına rağmen benzer doğruluk oranlarına ulaşabilmektedir. Budama; mobil uygulamalar, IoT cihazları ve kenar bilişim (edge computing) gibi hesaplama kapasitesinin sınırlı olduğu ortamlarda dağıtımı kolaylaştırır. Günümüzde budama çoğunlukla niceleme (quantization) ve bilgi damıtma (knowledge distillation) ile bir arada uygulanarak çok daha yüksek sıkıştırma oranlarına ulaşılır.
Radial Basis Function Network (Radyal Tabanlı Fonksiyon Ağı)
Radyal Tabanlı Fonksiyon Ağı (RBF Network), gizli katmanındaki nöronların doğrusal olmayan radyal tabanlı aktivasyon fonksiyonları kullandığı, üç katmanlı bir ileri beslemeli yapay sinir ağıdır. Ağ; bir giriş katmanı, RBF nöronlarından oluşan tek bir gizli katman ve doğrusal çıkış katmanından meydana gelir. RBF ağlarının temeli 1988 yılında Broomhead ve Lowe tarafından atılmıştır. Gizli katmandaki her nöron, bir merkez vektörü (μ) ve bir genişlik parametresi (σ) ile tanımlanır; girdi vektörünün bu merkeze olan Öklid uzaklığını bir aktivasyon değerine dönüştürür. En yaygın kullanılan aktivasyon fonksiyonu Gauss fonksiyonudur: φ(x) = exp(−‖x − μ‖² / 2σ²). Girdi merkeze yaklaştıkça aktivasyon 1'e, uzaklaştıkça 0'a yaklaşır. σ parametresi nöronun kapsama alanını belirler: küçük σ dar ve yerel bir etki bölgesi yaratırken büyük σ girdi uzayının daha geniş bir alanını etkiler. Eğitim süreci iki aşamada gerçekleşir. Birinci aşamada gizli katmanın merkez vektörleri k-ortalamalar algoritması gibi gözetimsiz yöntemlerle belirlenir; ağ, etiket gerektirmeksizin verinin geometrik yapısını keşfeder. İkinci aşamada çıkış katmanının ağırlıkları en küçük kareler yöntemiyle öğrenilir; bu aşama dışbükey bir optimizasyon problemidir ve tek bir global minimuma sahiptir. RBF ağları, çok katmanlı algılayıcı (MLP) yapısına göre birçok avantaj sunar: eğitim çok daha hızlıdır, yerel minimumlara takılma riski düşüktür ve her nöronun merkez noktası veri uzayında somut bir konumu temsil ettiğinden model yorumlanabilirdir. Gauss kernel kullanan Destek Vektör Makinesi (SVM), matematiksel olarak RBF ağının özel bir formu olarak görülebilir; bu bağlantı çekirdek yöntemleri ile klasik sinir ağları arasındaki köprüyü somutlaştırır. Fonksiyon yaklaşımı, zaman serisi tahmini, sınıflandırma, enterpolasyon ve kontrol sistemleri başlıca uygulama alanlarıdır. Öte yandan yüksek boyutlu giriş uzaylarında yeterli kapsama için merkez sayısının aşırı artması (boyutsallık laneti) ciddi bir kısıt oluşturur; bu tür problemlerde derin öğrenme mimarileri tercih edilmektedir.
Regularization (Düzenlileştirme)
Düzenlileştirme (Regularization), makine öğrenimi modellerinin eğitim verisine aşırı uyum sağlaması (overfitting) problemini önlemek için kayıp fonksiyonuna ek bir ceza terimi ekleyen teknikler ailesidir. Temel amaç, modelin eğitim setini ezberlemek yerine görülmemiş verilere genelleştirme kapasitesini artırmaktır. Aşırı öğrenme (overfitting), bir modelin eğitim verilerindeki gürültüyü ve ayrıntıları kapasitesi sayesinde öğrenmesi ama yeni veriye uygulandığında başarısız olması durumudur. Düzenlileştirme bu sorunu ağırlık değerlerini küçük tutmaya zorlayarak çözer: büyük ağırlıklar modelin tek veri noktalarına aşırı duyarlı olduğuna işaret eder; ceza terimi bu değerleri sıfıra yakın tutarak daha düz ve genelleşebilir bir karar sınırı öğretir. **L2 Düzenlileştirme (Ridge / Ağırlık Sönümlemesi)** en yaygın yöntemdir. Kayıp fonksiyonuna tüm ağırlıkların karelerinin toplamı λΣw² eklenir. Bu formülasyon büyük ağırlıkları cezalandırır ama hiçbirini tam sıfıra indirgemez; sonuç olarak tüm özellikler modelde küçük de olsa katkıda bulunur. Deep learning'de "weight decay" olarak da anılır ve PyTorch optimizer'larında `weight_decay` parametresiyle doğrudan kullanılır. **L1 Düzenlileştirme (Lasso)**, λΣ|w| ceza terimiyle bazı ağırlıkları tam sıfıra iter; bu sayede otomatik özellik seçimi gerçekleşir. Yüzlerce özellik içinden yalnızca birkaç kritik birinin önemli olduğu durumlar için idealdir. L1 ile L2'yi birleştiren Elastic Net, her iki avantajdan yararlanır. **Dropout**, derin sinir ağlarına özgü güçlü bir düzenlileştirme yöntemidir: eğitim sırasında her adımda nöronların rastgele bir oranı (ör. %20-50) devre dışı bırakılır. Model, belirli nöronlara güvenemeyeceği için farklı yollarla aynı sonuca ulaşmayı öğrenir; bu da ansambl etkisi yaratır. Çıkarım sırasında tüm nöronlar etkin olur ve ağırlıklar bırakma oranıyla ölçeklenir. **Erken Durdurma (Early Stopping)**, doğrulama kaybı artmaya başladığı noktada eğitimi kesen örtük bir düzenlileştirme yöntemidir. Model henüz eğitim setini ezberlemeye geçmeden öğrenme durdurulur. Uygulamada λ hiperparametresi kademeli grid search veya Bayesian optimizasyonla ayarlanır; çok büyük λ modeli yetersiz öğrenmeye (underfitting) iter.
ReLU (Doğrultulmuş Doğrusal Birim)
ReLU, yapay sinir ağlarında nöronların çıktısını belirleyen bir aktivasyon fonksiyonudur. Formülü basittir: girdi sıfırdan büyükse olduğu gibi geçer, sıfır veya altındaysa sıfır döner. Bu basitlik, derin ağlarda on yıl boyunca hâkim olan sigmoid ve tanh fonksiyonlarının yerini almasının asıl nedenidir. Sigmoid ve tanh, girdi değerleri çok büyüdüğünde ya da çok küçüldüğünde gradyanları neredeyse sıfıra yaklaştırır. Geri yayılım sırasında bu küçük gradyanlar katman katman çarpılır; on, yirmi katmanlı bir ağda en baştaki katmanlara ulaşan gradyan fiilen yokolur. Ağırlıklar güncellenemez, ağ öğrenemez. Bu soruna kaybolan gradyan problemi denir ve 1990'larda derin ağ araştırmalarının önündeki en büyük engellerden biriydi. ReLU bu problemi doğrudan çözer. Pozitif girdiler için gradyan her zaman 1'dir; çarpma işlemi değeri küçültmez. Bunun yanı sıra üs veya üstel fonksiyon gerektirmediğinden hesaplaması sigmoid ve tanh'a göre çok daha hızlıdır. GPU'larda paralel işlem yapıldığında bu fark büyük ağlarda ciddi zaman tasarrufuna dönüşür. Pratikteki etkisi 2012 AlexNet modeliyle belgelenmiştir. Krizhevsky ve ekibi, aynı mimaride sigmoid yerine ReLU kullanarak eğitim süresini altıda bire indirmiştir. O tarihten bu yana derin öğrenmede gizli katman aktivasyonu denildiğinde varsayılan seçenek ReLU olmuştur. Ancak ReLU kusursuz değildir. Negatif girdi alan nöronlar sürekli sıfır çıktısı üretir ve gradyanları sıfır olduğundan bir daha güncellenemezler. Buna ölü ReLU problemi denir. Yüksek öğrenme hızı kullanıldığında veya ağırlıklar olumsuz başlatıldığında ağdaki nöronların önemli bir kısmı bu duruma düşebilir. Bu soruna karşı geliştirilen varyantlar mevcuttur: Leaky ReLU negatif girdiler için küçük bir eğim (genellikle 0,01) kullanır. PReLU bu eğimi öğrenilebilir bir parametre haline getirir. ELU negatif bölgede üstel bir eğri kullanarak ortalama aktivasyonu sıfıra yaklaştırır. GELU ise girdiyi bir olasılık ağırlığıyla çarpar ve özellikle dil modellerinde (BERT, GPT) tercih edilir. ReLU bugün evrişimli sinir ağlarında, derin tam bağlantılı ağlarda ve görüntü sınıflandırma modellerinin büyük çoğunluğunda gizli katman aktivasyonu olarak kullanılmaktadır.
Reservoir Computing (Rezervuar Hesaplama)
Reservoir Computing (Rezervuar Hesaplama), tekrarlayan sinir ağlarının (RNN) eğitilmesindeki klasik güçlükleri aşmak için tasarlanmış bir hesaplama çerçevesidir. Yöntemin özü şudur: büyük, karmaşık ve rastgele bağlantılı bir "rezervuar" ağının ağırlıkları sabittir ve hiç güncellenmez; yalnızca çıkış katmanı (readout) eğitilir. Bu yaklaşım, geri yayılım boyunca zamanla çoğalan gradyan sorunlarını (vanishing/exploding gradient) tamamen ortadan kaldırır ve eğitimi basit bir doğrusal regresyon problemine indirger. Reservoir Computing'in iki temel mimarisi vardır. 2001 yılında Herbert Jäger tarafından geliştirilen Echo State Network (ESN), seyrek bağlantılı ve rastgele ağırlıklı tekrarlayan bir ağdan oluşur; girdi sinyali bu ağı sürer, ağın zengin iç durumları zaman içindeki dinamikleri yüksek boyutlu bir uzayda kodlar. 2002'de Wolfgang Maass ve ekibi tarafından önerilen Liquid State Machine (LSM) ise biyolojik sinir ağlarından ilham alarak spiking (çekirdek ateşlemeli) nöronları kullanan karşılaştırılabilir bir yaklaşımdır. Bir rezervuarın en kritik hiperparametresi spektral yarıçaptır: ağırlık matrisinin en büyük özdeğerinin mutlak değeri. Bu değer 1'den küçük olduğunda sistem "Echo State Property"ye sahip olur; yani geçmiş girdilerin etkisi zaman içinde sönümlenir ve sistem kararlı kalır. Tipik değerler 0,9-0,99 arasındadır. Spektral yarıçap 1'i aşarsa sistem kaotik davranışa sürüklenir; çok küçük olursa geçmiş bilgiyi yeterince koruyamaz ve bellek kapasitesi düşer. Uygulama alanları geniştir: Lorenz attraktörü gibi kaotik sistem tahmini, zaman serisi öngörüsü, finansal veri modelleme, konuşma tanıma, robotik motor kontrolü ve biyomedikal sinyal işleme bu alanların başında gelir. Son yıllarda fotonik, optik ve kuantum ortamlarında gerçekleştirilen fiziksel rezervuar hesaplama, son derece düşük enerji tüketimiyle donanım seviyesinde gerçek zamanlı hesaplama olanağı sunan yeni bir araştırma yönü açmıştır. Geleneksel LSTM ve GRU mimarilerine kıyasla Reservoir Computing; çok daha hızlı eğitim, düşük veri gereksinimi ve kısıtlı donanımda çalışabilme avantajları sunmaktadır. Buna karşın rezervuar boyutu ve hiperparametre ayarı, sistemin performansını belirleyen kritik tasarım kararlarıdır. Eğitilebilir parametre sayısının görece azlığı, yüksek boyutlu ve büyük ölçekli veri kümelerinde kapasiteyi sınırlayabilir; bu nedenle derin öğrenme ve rezervuar yaklaşımları çoğu zaman tamamlayıcı olarak değerlendirilmektedir.
Residual Attention Ağı (Artıksal Dikkat Ağı)
Residual Attention Ağı (Residual Attention Network — RAN), Fei Wang ve ekibinin CVPR 2017'de tanıttığı, ResNet'in artıksal öğrenme prensibiyle dikkat mekanizmasını harmanlayan bir evrişimli sinir ağı mimarisidir. Temel fikir, her dikkat modülünü iki paralel dalla çalıştırmaktır: özellik dönüşümü gerçekleştiren trunk branch ile bu özellikler üzerinde yumuşak uzamsal dikkat maskeleri üreten mask branch. Trunk branch standart evrişimsel katmanlardan oluşurken mask branch encoder-decoder yapısına sahiptir. Max-pooling ile özellik haritası aşamalı olarak küçültülür (downsampling); ardından bilinear üst örnekleme (upsampling) ile orijinal çözünürlüğe geri döner. Mask branch çıktısı sigmoid aktivasyonuyla [0,1] aralığına sıkıştırılarak yumuşak maske oluşturulur. Bu maske trunk çıktısıyla eleman çarpımı (element-wise multiplication) uygulanır: yüksek dikkat değeri taşıyan bölgeler güçlendirilirken düşük değerli gürültülü ya da alakasız bölgeler baskılanır. Artıksal bağlantı bu noktada kritik rol üstlenir: dikkat çıktısına orijinal trunk özelliği eklenir (H = F × M + F; burada F trunk özelliği, M ise maske). Bu formülasyon maskenin sıfıra yaklaştığı durumda bile ham trunk sinyalinin korunmasını güvence altına alır; dolayısıyla dikkat modülleri ağı degrade etmeden katman derinliği arttıkça birikimli dikkat öğrenilmesine izin verir. Orijinal çalışmada dikkat modülleri üç uzamsal çözünürlük aşamasında bağımsız olarak öğrenilir. Başarım açısından CIFAR-10'da %3.90, CIFAR-100'de %20.45 ve ImageNet Top-5 sınıflandırmasında %4.8 hata oranı elde edilerek dönemin referans sonuçlarının üzerine çıkılmıştır. Mimari etki açısından RAN, CBAM (Convolutional Block Attention Module, ECCV 2018), BAM (Bottleneck Attention Module) ve kanal dikkatini uzamsal dikkatle birleştiren birçok türev çalışmaya ilham vermiştir. Modern nesne tespiti mimarileri (YOLO serileri), U-Net türevi medikal görüntü segmentasyonu modelleri ve uydu görüntü işleme uygulamaları dikkat kapıları (attention gating) mekanizmasını doğrudan bu çalışmanın çizgisinden devşirmiştir. Türkiye'deki bilgisayarlı görü araştırma grupları patoloji görüntüsü analizi ve uzaktan algılama problemlerinde artıksal dikkat mimarilerini referans almaktadır.
Residual Network (ResNet) (Artık Ağ (ResNet))
Residual Network (ResNet), derin sinir ağlarındaki gradyan kaybı problemini atlama bağlantıları (skip connections) ile çözen ve yüzlerce katmanlı ağların eğitimini mümkün kılan derin öğrenme mimarisidir. 2015 yılında Kaiming He, Xiangyu Zhang, Shaoqing Ren ve Jian Sun tarafından Microsoft Research'te geliştirildi; "Deep Residual Learning for Image Recognition" makalesi 250 binden fazla atıfla derin öğrenme tarihinin en çok referans verilen çalışmalarından biridir. ResNet-152, ILSVRC 2015 (ImageNet) yarışmasını yüzde 3,57 top-5 hata oranıyla kazandı ve insan seviyesi kabul edilen yüzde 5 sınırının altına indi. ResNet'ten önce ağ derinleştikçe doğruluk artacağına düşüyordu: 56 katmanlı düz bir ağ, 20 katmanlı olandan hem eğitim hem test setinde daha kötü sonuç veriyordu. Bu bozunma (degradation) sorununun kaynağı, geri yayılım sırasında hata sinyalinin katmanlar boyunca üstel olarak küçülmesi, yani gradyan kaybıydı. ResNet'in temel fikri artık öğrenmedir (residual learning). Klasik bir katman hedef dönüşüm H(x)'i doğrudan öğrenmeye çalışır; ResNet bloğu ise yalnızca artığı, F(x) = H(x) − x farkını öğrenir ve çıktıyı F(x) + x toplamıyla üretir. Eklenen kimlik kısayolu (identity shortcut) ek parametre getirmez, gradyanın alt katmanlara engelsiz akmasına izin verir ve bir katmanın işlevsiz kalması gerektiğinde F(x)'in sıfıra itilmesini yeterli kılar. Varyantlar katman sayısıyla anılır: ResNet-18, 34, 50, 101 ve 152. ResNet-50'den itibaren 1×1 → 3×3 → 1×1 konvolüsyonlu bottleneck bloklar hesap yükünü düşürür; ResNet-50 yaklaşık 25,6 milyon parametre ve 4,1 GFLOP ile hız-doğruluk dengesinin endüstri standardı olmuştur. Artık bağlantı fikri bilgisayarla görmenin ötesine taştı: Transformer mimarisinin her katmanı, dolayısıyla GPT-5, Claude Opus 4.5 ve Gemini 3 gibi 2026'nın büyük dil modelleri aynı prensiple çalışan bir residual stream üzerine kuruludur. Nesne tespiti (Faster R-CNN, YOLO ailesi), anlamsal bölütleme, tıbbi görüntü analizi ve uydu görüntüsü işleme alanlarında ResNet omurgaları hâlâ referans modeldir.
RoPE (Dönel Konum Kodlama)
RoPE (Rotary Position Embedding — Dönel Konum Kodlama), transformer tabanlı dil modellerinde token konumlarını temsil etmek için 2021 yılında Jianlin Su ve ekibi tarafından önerilen özgün bir konum kodlama yöntemidir. Geleneksel mutlak konum gömme yaklaşımlarının (sinüs/kosinüs PE veya öğrenilmiş vektörler) yetersiz kaldığı bağlam uzunluğu genellenebilirliği sorununu zarif biçimde çözer. Temel fikir, her tokenın sorgu (query) ve anahtar (key) vektörlerini, o tokenın sekans içindeki konumuna bağlı bir açıyla karmaşık sayı uzayında döndürmektir. Böylece iki token arasındaki dikkat puanı (dot product), yalnızca konumlar arasındaki farka (m−n) bağlı hale gelir; modelin öğrenmesi gereken göreli konum bilgisi, dikkat hesaplamasına doğal olarak yerleşmiş olur. Matematiksel olarak d-boyutlu vektör, d/2 adet iki boyutlu alt uzaya ayrılır. Her alt uzay için farklı bir taban frekans θ_i = 10000^(−2i/d) kullanılır. Yüksek frekanslı boyutlar yakın komşuluk ilişkilerini, düşük frekanslı boyutlar uzun menzilli yapısal bağları kodlar. Bu çok ölçekli yapı, hem kısa sözcüksel hem de uzun sözdizimsel örüntüleri bir arada temsil eder ve dikkat mekanizmasına yönelik uzaklık yatırılabilirliği (distance invariance) özelliği kazandırır. RoPE'un pratik avantajları önemlidir: ekstra parametre gerektirmez; göreli konum farkındalığı sinüs PE'ye göre çok daha güçlüdür; bağlam uzunluğu genişletmesi (YaRN, NTK scaling, LongRoPE gibi yöntemler) ile eğitim penceresinin 4 ila 128 katına çıkılabilir. Flash Attention gibi bellek verimli kernel'larla tam uyumludur ve hesaplama maliyeti ihmal edilebilir düzeyde kalır. Meta'nın LLaMA serisi (1, 2, 3), Mistral, Gemma (Google DeepMind), Qwen (Alibaba), DeepSeek ve Falcon gibi modern açık kaynaklı dil modelleri RoPE'u standart konum kodlaması olarak benimsemiştir. Bu yaygın kullanımın arkasında RoPE'un matematiksel sağlamlığı, uygulanmasının kolaylığı ve bağlam uzatmada gösterdiği üstün esneklik yatar. Günümüzde RoPE, açık kaynak LLM ekosisteminin fiili standardı konumundadır.
Siamese Network (Siyam Ağı)
Siyam Ağı (Siamese Network), ağırlık paylaşan iki veya daha fazla özdeş alt ağ (branch) kullanarak girdi çiftleri ya da üçlüleri arasındaki benzerliği öğrenen derin öğrenme mimarisidir. Adını 19. yüzyılda yaşamış Chang ve Eng Bunker isimli siyam ikizlerinden alan bu yapı, her iki dalda da tamamen aynı ağırlıkların kullanılmasını zorunlu kılar; bu durum iki girdinin aynı özellik uzayında karşılaştırılabilmesini güvence altına alır. Çalışma mekanizması şu biçimde özetlenebilir: her girdi kendi dalından geçerek sabit boyutlu bir özellik vektörüne (embedding) dönüştürülür. Ardından iki vektör arasındaki Öklid ya da kosinüs uzaklığı hesaplanır. Eğitim sırasında model, benzer çiftlerin gömülü vektörlerini birbirine yaklaştırırken farklı çiftlerin vektörlerini birbirinden uzaklaştıracak şekilde güncellenir. Bu öğrenme süreci contrastive loss veya triplet loss işlevleriyle yönlendirilir. Contrastive loss, benzer çiftlerin uzaklığını minimize ederken farklı çiftlerin uzaklığını belirli bir marjin üstüne iter ve ikili etiket gerektirir. Triplet loss ise bir çapa (anchor), bir pozitif (benzer) ve bir negatif (farklı) örnek üçlüsüyle çalışır; FaceNet ve modern yüz tanıma sistemlerinin büyük çoğunluğu bu yaklaşımı kullanır. Siyam ağlarının en güçlü özelliği, one-shot öğrenmedir. Klasik sınıflandırıcılar bir sınıfı tanımak için yüzlerce veya binlerce etiketli örnek isterken siyam ağları benzerlik ölçümünü doğrudan öğrendiğinden, test sırasında yeni bir sınıfın tek bir örneği verilse bile bu sınıfı diğerlerinden ayırt edebilir. Bu özellik etiketleme maliyetinin yüksek olduğu tıbbi görüntüleme ve adli bilişim gibi alanlarda büyük değer taşır. Öne çıkan uygulamalar şunlardır: Google FaceNet yüz doğrulama ve tanıma, imza doğrulama sistemleri, yazı karakter tanıma (Omniglot veri seti) ve tıbbi görüntülemede nadir hastalıkların tespiti. Siyam ağları, sınırlı veriyle yüksek doğruluk gerektiren her senaryoda tercih edilen bir mimari olmayı sürdürmektedir.
Sigmoid Fonksiyonu (Sigmoid Fonksiyonu)
Sigmoid fonksiyonu, matematiksel gösterimi σ(x) = 1 / (1 + e^(-x)) olan ve her gerçel sayıyı 0 ile 1 arasındaki açık aralığa eşleyen S şekilli bir aktivasyon fonksiyonudur. Lojistik fonksiyon adıyla da anılan sigmoid, yapay sinir ağlarının ve klasik makine öğrenmesinin en eski yapı taşlarından biridir. Girdi eksi sonsuza giderken çıktı sıfıra, artı sonsuza giderken bire yaklaşır; x = 0 noktasında ise tam 0.5 değerini alır. Bu davranış, fonksiyonun çıktısını doğrudan bir olasılık gibi okumaya izin verir ve sigmoid'i ikili sınıflandırma problemlerinin çıkış katmanı için doğal bir seçim yapar: model, bir e-postanın spam olma ya da bir hastanın belirli bir tanıya sahip olma olasılığını tek bir sayıyla ifade edebilir. Fonksiyonun türevi σ'(x) = σ(x) · (1 - σ(x)) biçiminde, yani fonksiyonun kendi değeri üzerinden hesaplanır. Bu sadelik, 1986'da geri yayılım algoritmasının yaygınlaşmasıyla birlikte sigmoid'i sinir ağı eğitiminin standart aktivasyonu haline getirdi. 1990'ların ve 2000'lerin başındaki çok katmanlı algılayıcıların büyük bölümü gizli katmanlarında sigmoid kullanıyordu. Aynı türev, sigmoid'in en bilinen zayıflığını da açıklar. Türevin alabileceği en yüksek değer 0.25'tir ve |x| büyüdükçe hızla sıfıra iner. Derin bir ağda geri yayılım sırasında bu küçük türevler katman katman çarpıldığından, ilk katmanlara ulaşan gradyan neredeyse yok olur. Gradyan kaybı (vanishing gradient) olarak bilinen bu sorun, sigmoid tabanlı derin ağların eğitilmesini pratikte imkânsız hale getiriyordu. Ayrıca çıktının sıfır merkezli olmaması ağırlık güncellemelerinin hep aynı yönde ilerlemesine, üstel hesaplama ise ek işlem maliyetine yol açar. Bu nedenlerle modern derin öğrenme mimarileri gizli katmanlarda ReLU, GELU ve benzeri fonksiyonları tercih eder. Sigmoid ise varlığını üç önemli alanda sürdürür: ikili ve çok etiketli sınıflandırmanın çıkış katmanı, lojistik regresyonun olasılık dönüşümü ve LSTM ile GRU hücrelerindeki kapı mekanizmaları. Bu kapılar, bilginin ne kadarının hücre durumuna yazılacağını ya da silineceğini 0 ile 1 arasında bir katsayıyla belirler; tam da sigmoid'in ürettiği türden bir değer. Kısacası sigmoid, derin ağların gizli katmanlarından çekilmiş olsa da olasılık üretmenin gerektiği her yerde hâlâ vazgeçilmezdir.
Skip Connection (Atlama Bağlantısı)
Skip connection (atlama bağlantısı), derin sinir ağı mimarilerinde bir katmanın girdisinin bir veya daha fazla katman atlanarak ileriki bir katmana doğrudan iletilmesi tekniğidir. 2015 yılında Microsoft Research ekibinin ResNet (Residual Network) mimarisinde popüler hale getirdiği bu yapı, derin öğrenme tarihinin en etkili mimari yeniliklerinden biri olarak kabul edilmektedir. Derin sinir ağlarının temel sorunu, gradyan kaybı (vanishing gradient) problemidir: geri yayılım (backpropagation) sırasında hata sinyali katmanlar boyunca üstel biçimde küçülerek iletilir ve en alt katmanlar öğrenme sürecinden yetersiz yararlanır. 2015 öncesinde 20-30 katmanı aşan ağlar pratikte eğitilemiyordu. Skip connection bu sorunu köklü biçimde çözer. Mathematiksel olarak bir skip connection bloğu şu şekilde ifade edilir: çıktı = F(x) + x. Burada F(x) katmanların öğrendiği artık (residual) dönüşümü, x ise doğrudan iletilen kimlik terimidir. Bu toplama işlemi, gradyanın hem dönüşüm yolundan hem de kesintisiz kimlik yolundan geriye akabilmesini sağlar. Ağ artık hedef çıktıyı sıfırdan öğrenmek yerine yalnızca neyin değişmesi gerektiğini öğrenir; bu da eğitimi hem hızlandırır hem de stabilize eder. Skip connection, yalnızca bilgisayarla görme alanında değil, modern yapay zeka ekosisteminin tamamında kalıcı bir iz bırakmıştır. Transformer mimarisi her encoder ve decoder bloğunda skip connection ile katman normalizasyonunu (layer normalization) birleştiren yapıyı kullanır. GPT, BERT, ViT ve LLaMA gibi büyük dil modelleri ile görüntü dönüştürücülerinde bu tasarım ilkesi temel bir bileşen haline gelmiştir. U-Net medikal görüntülemede encoder-decoder bağlantıları için, DenseNet ise yoğun bağlantı blokları için farklı skip connection türleri kullanır. Skip connection'ın önemi, 2015 ImageNet yarışmasında ResNet-152'nin insan düzeyini aşan yüzde 3.57 hata oranıyla birinci gelmesiyle somutlaşmıştır. Bu sonuç, derin öğrenme topluluğunun ağ derinliğine bakışını kökten değiştirmiş ve yüzlerce hatta binlerce katmanlı modellerin eğitilmesinin önünü açmıştır.
Softmax (Softmax Fonksiyonu)
Softmax fonksiyonu, yapay sinir ağlarında çok sınıflı sınıflandırma görevlerinde kullanılan temel matematiksel dönüşümdür. Ham model çıktıları olan logit vektörünü alır ve tüm elemanları (0, 1) aralığında, toplamı tam olarak 1'e eşit olan bir olasılık dağılımına dönüştürür. Matematiksel formülü σ(zᵢ) = exp(zᵢ) / Σⱼ exp(zⱼ) şeklindedir; her bileşen üstel fonksiyondan geçirilip normalize edilir. Fonksiyon, üstel doğası gereği büyük değerleri daha da büyütür, küçük değerleri bastırır. Bu sayede model en olası sınıfı ön plana çıkarır; sonuçlar doğrudan sınıf üyeliği olasılığı olarak yorumlanır. İkili sınıflandırma için kullanılan sigmoid fonksiyonunun her çıktıyı bağımsız olarak 0-1 aralığına sıkıştırmasından farklı olarak softmax, vektör düzeyinde çalışır ve sınıflar arasında rekabetçi normalizasyon yapar; toplamın daima 1 olması garantilendiğinden çıktılar doğru olasılık semantiği taşır. Sayısal kararlılık kritik bir konudur. Büyük logit değerlerinde exp(zᵢ) kayan nokta taşmasına yol açabilir. Standart çözüm, tüm bileşenlerden maksimum değeri çıkarmaktır: σ(zᵢ) = exp(zᵢ − max(z)) / Σⱼ exp(zⱼ − max(z)). Bu form matematiksel olarak özdeştir ama üstel değerleri kontrol altında tutar. PyTorch, TensorFlow ve NumPy bu optimizasyonu dahili olarak uygular. Sıcaklık ölçeklendirmesi (temperature scaling), fonksiyonun davranışını ayarlamak için kullanılır: Softmax(z / T). T = 1 standart çıktı, T büyüdükçe daha yayvan ve belirsiz bir dağılım, T küçüldükçe ise daha keskin ve kararlı bir dağılım ortaya çıkar. Bilgisinin damıtımı (knowledge distillation) tekniğinde yüksek sıcaklık kullanılarak öğretmen modelin logitleri yumuşatılır; öğrenci model sert etiketler yerine bu yumuşak hedefleri öğrenerek daha iyi genelleme yapar. Transformers mimarisindeki dikkat mekanizmasında da softmax merkezi bir rol üstlenir. Sorgu (Q) ve anahtar (K) matrislerinin nokta çarpımı hesaplanır; boyut ölçeklendirmesiyle √d_k'ya bölünür, ardından softmax uygulanarak her sorgu pozisyonu için dikkat ağırlıkları elde edilir: Attention(Q, K, V) = softmax(QK⊤ / √d_k) · V. Burada softmax iki işlevi bir arada yerine getirir: ağırlıkların toplamını 1'e normalize eder ve modelin seçici odaklanmasını destekler.
Spiking Neural Network (SNN) (Atlayan Sinir Ağı)
Spiking Neural Network (SNN), beyin biyolojisinden ilham alınarak tasarlanmış üçüncü nesil yapay sinir ağı mimarisidir. Klasik derin öğrenme modellerinde nöronlar sürekli kayan noktalı aktivasyon değerleri iletirken, SNN'lerde nöronlar yalnızca yeterli uyarı biriktiğinde kısa süreli elektriksel atışlar (spike) gönderir. Bu olay tabanlı ve seyrek hesaplama paradigması biyolojik nöronların çalışma prensibini yansıtır; güç yalnızca spike üretildiğinde tüketilir ve klasik GPU'lara kıyasla dramatik enerji tasarrufu elde edilir. En yaygın SNN nöronu modeli Leaky Integrate-and-Fire'dır (LIF). Bu modelde nöron, gelen giriş sinyallerini bir membran potansiyeli olarak biriktirir; potansiyel bir eşik değerini (threshold) aştığında spike gönderir ve ardından sıfırlanır. Leaky özelliği, uyarı alınmadığında membran potansiyelinin zamanla azalmasını ifade eder; bu mekanizma biyolojik yorgunluk ve gürültü bastırma işlevine karşılık gelir. LIF'in yanı sıra daha karmaşık Hodgkin-Huxley modeli ve Adaptive Exponential Integrate-and-Fire (AdEx) modeli de araştırma ortamlarında kullanılır. SNN'lerin eğitimi temel bir zorluk içerir: spike fonksiyonu süreksiz ve türevlenemezdir; bu nedenle standart geri yayılım (backpropagation) doğrudan uygulanamaz. Bu sorunu çözmek için surrogate gradient yöntemi kullanılır: ileri geçişte gerçek spike fonksiyonu, geri geçişte ise sigmoid veya piecewise linear gibi yumuşak bir yaklaşım kullanılır. Spike Timing Dependent Plasticity (STDP) ise biyolojik ilhamlı yerel öğrenme kuralıdır; ön sinaps nöronun art sinaps nörondan önce ateşlenmesi bağlantıyı güçlendirir, tersine ateşlenmesi ise zayıflatır. Nöromorhik donanım, SNN'lerin yüksek verimlilikle çalıştığı özel işlemci mimarileridir. Intel'in Loihi 2 çipi, her bir nöronik çekirdeğin 8.192 nöronu eş zamanlı simüle edebildiği bir platformdur. IBM TrueNorth ise 4.096 çekirdek ve 1 milyon nöronu çok düşük güç bütçesiyle çalıştırır. 2025 yılında Nature Communications'ta yayımlanan bir çalışma, 28 nm nöromorhik mimarinin FP16 hassasiyetinde 1,05 TFLOPS/W enerji verimliliği elde ettiğini ve A100 GPU'ya kıyasla bellek erişimini yüzde 55-85 oranında azalttığını göstermektedir. Araştırma tarafında PyNN ve SpikingJelly Python çerçeveleri SNN geliştirme ortamı sunar; SpikingJelly, PyTorch üzerine inşa edilerek GPU hızlandırmasını surrogate gradient ile birleştirmektedir.
Transformer-XL (Transformer-XL (Uzun Bağlamlı Dönüştürücü Mimarisi))
Transformer-XL, Zihang Dai ve ekibinin 2019 yılında Google Brain ile Carnegie Mellon Üniversitesi iş birliğiyle geliştirdiği, uzun bağlamı modelleme sorununu çözmek amacıyla önerilen bir dil modeli mimarisidir. Standart Transformer modelleri metin işlerken sabit uzunluktaki bölütleri birbirinden bağımsız olarak ele alır; bu durum cümle sınırlarını aşan bağlam bağımlılıklarının yakalanamamasına ve bölüt kenarlarında anlam kırılmasına yol açar. Transformer-XL bu sorunu iki temel yenilikle aşar: bölüt özyinelemesi ve göreli konum kodlaması. Bölüt özyinelemesi mekanizmasında her katmanın gizli durum tensörleri önbelleğe alınır ve bir sonraki bölüt işlenirken dikkat mekanizmasına ek bağlam olarak sunulur; bu yapı modelin erişebildiği bağlam uzunluğunu teorik olarak sonsuz kılabilir ve uzun mesafeli bağımlılıkların yakalanmasını mümkün kılar. Göreli konum kodlaması ise mutlak konum gömülerinin farklı bölüt uzunluklarında anlam kaybına yol açma sorununu giderir; dikkat mekanizması token çiftleri arasındaki göreli mesafeyi doğrudan hesapladığından model farklı bölüt konfigürasyonlarına kolayca genellenebilir hâle gelir. WikiText-103 ve enwiki8 standart kıyaslamalarında Transformer-XL yayımlandığı dönemde yeni başarım kayıtları kırmıştır. Eğitim aşamasında bölüt özyinelemesi devre dışı bırakılabilir; çıkarım aşamasında ise önbellekte tutulan gizli durumlar çok daha uzun metinlerin verimli biçimde işlenmesini kolaylaştırır. Hesaplama maliyeti açısından değerlendirildiğinde özyineleme uzunluğunun artmasıyla bellek kullanımı doğrusal olarak artar; bu denge üretim sistemleri için dikkate alınması gereken önemli bir tasarım kararıdır. Transformer-XL mimarisinin kalıcı etkisi ardından gelen büyük dil modellerine kattığı kavramsal zemindir. XLNet, permütasyon tabanlı dil modellemesiyle Transformer-XL üzerine inşa edilmiş ve BERT tarzı çift yönlü eğitimi oto-regresif modellemeyle birleştirmiştir. T5, GPT serisi ve günümüzün uzun bağlam modellerindeki pek çok tasarım kararı bu mimarinin deneyimlerinden beslenmiştir. Transformer-XL aynı zamanda artımlı çıkarım araştırmalarını da yönlendirmiş; literatürde iki binden fazla atıf alarak modern NLP tarihine geçmiştir.
Vanishing Gradient Problem (Kaybolan Gradyan Problemi)
Kaybolan Gradyan Problemi (Vanishing Gradient Problem), derin sinir ağlarında geri yayılım (backpropagation) sırasında gradyanların ağın giriş katmanlarına doğru ilerledikçe üstel biçimde küçülmesi ve pratikte sıfıra yaklaşmasıyla ortaya çıkan eğitim istikrarsızlığıdır. Bu durum, girişe yakın katmanların neredeyse hiç güncellenmemesine ve dolayısıyla ağın düzgün öğrenememesine yol açar. Sorunun matematiksel kökü, zincir kuralındaki çarpım yapısındadır. Sigmoid veya tanh aktivasyon fonksiyonlarının türevleri en fazla 0.25 değerini alır; bu nedenle L katmanlı bir ağda gradyan, geri yayılım sırasında her katmanda bu faktörle çarpılarak L. kuvvet kadar küçülür. 10 katmanlı bir ağda 0.25^10 ≈ 0.000001'lik bir küçülme, girişe yakın ağırlıkların güncellenmesini fiilen imkânsız hale getirir. Problem ilk kez Sepp Hochreiter tarafından 1991'deki diplom tezinde sistematik olarak analiz edilmiştir. Modern derin öğrenme, bu sorunu büyük ölçüde çözen birkaç teknik geliştirmiştir. **ReLU (Rectified Linear Unit)** aktivasyon fonksiyonu, pozitif değerler için türevi sabit 1 olarak tutar; bu sayede gradyan çarpımları zincirde birikmez. **Batch Normalization**, her katmanın çıkışını normalize ederek gradyan akışını düzenler ve çok daha derin ağların eğitilmesini mümkün kılar. **Skip Connection (artık bağlantı)**, He et al.'ın ResNet makalesinde (2015) önerilmiş; gradyanın katmanları atlayarak doğrudan önceki katmanlara akmasını sağlar ve 152 katmanlı ağların başarıyla eğitilmesine olanak tanımıştır. **LSTM (Long Short-Term Memory)**, kaybolan gradyan problemini aşmak amacıyla özel hücre geçiti mekanizmasıyla tasarlanmış bir RNN mimarisidir; Hochreiter & Schmidhuber tarafından 1997'de önerilmiştir. Kaybolan gradyan probleminin karşıtı olan **Patlayan Gradyan (Exploding Gradient)** sorununda ise gradyanlar kontrol edilemez biçimde büyür. Bu ikisi birlikte derin öğrenmenin iki temel eğitim istikrarsızlığını oluşturur. Patlayan gradyan için gradient clipping (gradyan kırpma) tekniği yaygın biçimde kullanılır. Günümüzde bu sorunların çözülmüş olması, yüzlerce hatta binlerce katmanlı ağların başarıyla eğitildiği modern derin öğrenme mimarilerinin zeminini hazırlamıştır.
Weights and Biases (Ağırlıklar ve Sapmalar)
Ağırlıklar (Weights) ve Sapmalar (Biases), bir yapay sinir ağındaki öğrenilebilir parametrelerin iki temel bileşenidir. Ağırlıklar, bir önceki katmandan gelen her girdinin çıktıya katkısının gücünü; sapmalar ise nöronun girdi sinyalinden bağımsız olarak tetiklenme eşiğini belirler. Model eğitimi bu iki parametre grubunun kayıp fonksiyonunu minimize edecek biçimde güncellenmesinden ibarettir. Matematiksel açıdan bir tam bağlantılı (fully connected) nöron şu işlemi gerçekleştirir: giriş vektörü x ile ağırlık matrisi W'nın iç çarpımı alınır, bias terimi b eklenir ve aktivasyon fonksiyonundan geçirilir: y = f(Wx + b). Ağırlıklar genellikle Xavier veya He başlatma yöntemleriyle rastgele, sapma değerleri ise sıfır veya küçük sabitlerle başlatılır; rastgele simetri kırma olmadan tüm nöronlar özdeş kalır. Eğitim sürecinde stokastik gradyan inişi (SGD) ve türevleri (Adam, AdamW, RMSProp) geri yayılım algoritmıyla hesaplanan gradyanlar yönünde parametreleri günceller. Öğrenme hızı (learning rate) bu adım büyüklüğünü kontrol eden kritik hiper parametredir; çok büyük öğrenme hızı kararsız eğitime, çok küçük öğrenme hızı ise yavaş yakınsamaya neden olur. Parametre sayısı model kapasitesini doğrudan belirler. GPT-3'ün 175 milyar, Llama 3.1 405B'nin ise 405 milyar parametresi mevcuttur. Bu parametrelerin tamamı çoğunlukla Float16 veya BF16 biçiminde depolanır; 7 milyar parametreli bir model FP16'da yaklaşık 14 GB VRAM gerektirir. L1 ve L2 düzenlileştirme (regularization) yöntemleri, ağırlıkların aşırı büyümesini cezalandırarak aşırı öğrenmeyi (overfitting) dizginler. Transferi öğrenme (transfer learning) bağlamında önceden eğitilmiş bir modelin ağırlıkları yeni bir görev için başlangıç noktası olarak kullanılır. Sadece son katmanların ağırlıkları güncellenmesi (fine-tuning), tüm modeli sıfırdan eğitmeye kıyasla çok daha az veri ve hesaplama gerektirir. LoRA (Low-Rank Adaptation) ise ağırlık matrislerini düşük ranklı matrislerle temsil ederek eğitilecek parametre sayısını dramatik biçimde azaltır; bu yöntem büyük dil modellerinin tüketici donanımında ince ayarlanmasını mümkün kılan temel tekniktir.
Word2Vec (Kelime-Vektör Gömme Modeli)
Word2Vec, 2013 yılında Google'dan Tomas Mikolov ve ekibi tarafından geliştirilen, büyük metin korpuslarından kelime vektörleri öğrenen sinir ağı tabanlı bir gömme modelidir. Temel fikir, anlamsal açıdan birbirine yakın kelimelerin yüksek boyutlu uzayda da birbirine yakın noktalara karşılık gelmesidir; bu ilke dağılımsal anlam hipotezi olarak bilinir. Model iki farklı mimariyle eğitilebilir. CBOW (Continuous Bag of Words) mimarisinde bağlam kelimeleri girdi olarak alınır ve merkez kelime tahmin edilir; bu yaklaşım hızlı eğitim ve sık kelimelerde iyi performans sunar. Skip-gram mimarisinde ise tek bir merkez kelimeden yola çıkılarak çevresindeki bağlam kelimeleri tahmin edilir; bu yöntem nadir kelimeler için daha iyi temsiller üretir. Her iki mimari de negatif örnekleme (negative sampling) veya hiyerarşik softmax teknikleriyle milyonlarca parametreyi verimli biçimde optimize eder. Word2Vec'in en çarpıcı özelliği vektör aritmetiğine olanak tanımasıdır. 'Kral − Erkek + Kadın ≈ Kraliçe' örneği, modelin yalnızca birlikte geçme istatistiklerinden cinsiyet, rütbe ve meslek gibi soyut ilişkileri kodladığını göstermektedir. Bu ilişkiler çeviri, anlam genişlemesi ve metafor tespitinde kullanılmaktadır. Word2Vec'in sınırlılıkları da belirgindir: her kelime için tek bir sabit vektör üretir; bu nedenle 'banka' gibi çok anlamlı (polysemous) kelimelerde bağlama göre anlam ayrımı yapılamaz. ELMo (2018) bu sorunu LSTM tabanlı bağlama duyarlı temsiliyle çözmeye başladı; ardından gelen BERT ve GPT gibi transformer tabanlı modeller ise dinamik gömme anlayışını endüstri standardına taşıdı. Buna karşın Word2Vec, hesaplamalı maliyetinin son derece düşük olması nedeniyle kaynak kısıtlı ortamlarda, öneri sistemlerinde ve belge sınıflandırmasında hâlâ tercih edilmektedir. GloVe (Global Vectors for Word Representation) ve FastText, Word2Vec'in temellerini genişleten önemli alternatiflerdir: GloVe küresel birlikte geçme istatistiklerini kullanırken, FastText alt kelime parçalarını (subword) modelleyerek bilinmeyen kelimeleri de temsil edebilir.