category Gelişmiş Algoritmalar

Gelişmiş Algoritmalar kategorisi, yapay zeka ve makine öğrenimi alanındaki 54 temel terim ve kavramı kapsar: A* Algoritması, Adapter Tuning, Agentic RAG, Bayesian Optimization, Beam Search Decoding, Bi-Encoder. Her terim için tanım, örnek ve ilgili kavramları bu sayfadan keşfedebilirsiniz.

route

A* Algoritması (A* Arama Algoritması)

A* (A-yıldız) algoritması, 1968 yılında Peter Hart, Nils Nilsson ve Bertram Raphael tarafından Stanford Araştırma Enstitüsü'nde geliştirilen, graflar ve ağlar üzerinde en kısa yolu bulan sezgisel bir arama algoritmasıdır. Yapay zeka, robotik, oyun geliştirme ve navigasyon sistemlerinde en yaygın kullanılan yol bulma (pathfinding) yöntemi olma özelliğini korumaktadır. A*, Dijkstra algoritmasının garantili optimalliği ile sezgisel arama yöntemlerinin verimliliğini bir araya getirir. Temel değerlendirme fonksiyonu f(n) = g(n) + h(n) formülüyle tanımlanır: g(n) başlangıç noktasından mevcut düğüme ulaşmanın gerçek maliyetini, h(n) ise mevcut düğümden hedef noktaya olan tahmini mesafeyi (sezgisel fonksiyon) ifade eder. Bu iki bileşeni birleştirerek algoritma, hem geçmiş maliyeti hem de gelecekteki tahmini maliyeti optimize eder. Algoritmanın doğruluk ve optimallik garantisi, kullanılan sezgisel fonksiyonun kabul edilebilir (admissible) olmasına bağlıdır. Kabul edilebilir sezgisel, gerçek maliyeti hiçbir zaman olduğundan fazla tahmin etmez. Düzlemsel koordinatlarda sıklıkla kullanılan Öklid ve Manhattan mesafe formülleri bu kriteri karşılar. Sezgisel aynı zamanda tutarlı (consistent/monotone) olduğunda A* keşfedilen düğümleri yeniden ziyaret etmez ve bellek kullanımı azalır. A*, açık liste (open list) ve kapalı liste (closed list) veri yapılarıyla çalışır. Önce başlangıç düğümünü açık listeye ekler; her adımda f değeri en düşük düğümü seçer, komşularını değerlendirir ve listeyi günceller. Bu süreç hedefe ulaşılana veya tüm olası yollar tükenene kadar devam eder. Öncelik kuyruğu (priority queue) ile uygulandığında zaman karmaşıklığı O(E log V) mertebesindedir. Yapay zeka araştırmalarında A*, pekiştirmeli öğrenmede planlama problemlerinin çözümünde, doğal dil işlemede sözdizimi ağaçlarının aranmasında ve konfigürasyon uzaylarında robot hareket planlamasında kullanılmaktadır. Oyun motorlarında ise NPC (Non-Player Character) yapay zekasının temel navigasyon bileşeni olarak yaygındır. Büyük ölçekli harita uygulamalarında A* varyantları (IDA*, D* Lite) bellek ve hız optimizasyonu için tercih edilmektedir.

arrow_forward
code_blocks

Adapter Tuning (Adapter Eğitimi)

Adapter tuning (adapter eğitimi), önceden eğitilmiş büyük dil ve görü modellerini yeni bir göreve uyarlarken modelin kendi ağırlıklarına hiç dokunmayan, bunun yerine transformer katmanlarının arasına eklenen küçük öğrenilebilir modülleri (adapter) eğiten parametre-etkin ince ayar (PEFT) yöntemidir. Yöntem 2019 yılında Google'dan Houlsby ve arkadaşlarının "Parameter-Efficient Transfer Learning for NLP" çalışmasıyla yaygınlaştı. Bu tasarımda her transformer bloğunun içine, çok başlı dikkat ve ileri besleme alt katmanlarının çıkışına, darboğaz (bottleneck) yapısında iki küçük ağ yerleştirilir. Adapter, gelen d boyutlu gizli vektörü çok daha küçük bir r boyutuna indirir, doğrusal olmayan bir aktivasyondan geçirir, tekrar d boyutuna çıkarır ve sonucu artık (residual) bağlantıyla girişe ekler. Başlangıçta kimlik dönüşümüne yakın davrandığı için eğitim, temel modelin davranışını bozmadan başlar. Eğitim sırasında yalnızca adapter parametreleri ile katman normalizasyonu gibi birkaç küçük bileşen güncellenir; geri kalan yüz milyonlarca ya da milyarlarca ağırlık dondurulur. Houlsby ve ekibi BERT-large ile GLUE deneylerinde, görev başına yalnızca yüzde 3,6 ek parametreyle tam ince ayarın 0,4 puan yakınına ulaştıklarını raporladı. Darboğaz boyutu küçüldükçe bu oran yüzde birin altına iner. Adapter'ların asıl gücü modülerliktir. Her görev için ayrı bir adapter dosyası eğitilir, aynı temel model üzerinde onlarca adapter yan yana saklanır ve çıkarım anında istenen adapter yüklenir. Bu yapı, tek bir model kopyasıyla çok görevli servis kurmayı, hassas görev verisini temel modele işlemeden paylaşmayı ve yeni görev eklerken eski görevlerde felaket unutma yaşamamayı mümkün kılar. AdapterHub platformu, adapters kütüphanesi, MAD-X ve AdapterFusion gibi uzantılarla birlikte çok dilli transfer ve görevler arası bilgi birleştirme için hazır bir ekosistem sunar. LoRA ile karşılaştırıldığında adapter, ağırlık matrislerine düşük rankli bir güncelleme eklemek yerine katman sırasına yeni bir blok sokar; bu nedenle çıkarımda küçük ama ölçülebilir bir gecikme payı vardır ve ağırlıklarla birleştirilemez. Buna karşılık adapter'lar tak-çıkar biçimde bir araya getirilebilir, üst üste istiflenebilir ve dil ile görev bilgisini ayrı modüllerde tutabilir. Gecikmenin kritik olduğu servislerde LoRA, modülerliğin ve paylaşımın öne çıktığı senaryolarda ise adapter tuning daha uygun bir tercihtir.

arrow_forward
code_blocks

Agentic RAG (Ajanlı Erişim Artırımlı Üretim)

Agentic RAG (Ajanlı Erişim Artırımlı Üretim), klasik Retrieval-Augmented Generation (RAG) mimarisini ajan tabanlı planlama ve akıl yürütmeyle birleştiren ileri düzey bir yapay zeka yaklaşımıdır. Geleneksel RAG'da bilgi erişimi tek adımda gerçekleşir: kullanıcı sorusu vektör veritabanında aranır, bulunan belgeler dil modeline bağlam olarak aktarılır ve model tek seferde yanıt üretir. Agentic RAG bu doğrusal akışı dinamik bir döngüye dönüştürür. Ajan önce soruyu analiz eder, hangi bilgiye ihtiyaç duyduğuna karar verir, birden fazla kaynakta arama yapar, gelen sonuçları değerlendirir ve yeterli bulmazsa sorguyu yeniden formüle ederek aramayı tekrarlar. Ajanın temel yetenekleri dört başlıkta toplanır: sorgu ayrıştırma (karmaşık soruyu alt sorulara bölme), çok atlamalı erişim (bir aramanın sonucunu bir sonraki aramanın girdisi yapma), öz eleştiri (toplanan bağlamı ve taslak yanıtı kendi kendine denetleme) ve yinelemeli iyileştirme (yanıtı adım adım güçlendirme). Bu yetenekler bir araya geldiğinde sistem, tek adımlı RAG'ın yetersiz kaldığı karmaşık, çok kaynaklı ve zincirleme akıl yürütme gerektiren sorularda belirgin biçimde daha doğru yanıtlar üretir. Mimari açıdan bir Agentic RAG sistemi genellikle bir orkestrasyon katmanı (LangGraph, AutoGen, CrewAI gibi), birden fazla erişim aracı (vektör veritabanı, web araması, SQL sorgusu, harici API), bir değerlendirici modül ve bellek bileşeni içerir. LlamaIndex ve LangChain bu mimariyi kuran hazır bileşenler sunar. 2023 sonunda yayımlanan Self-RAG ve FLARE makaleleri, modelin ne zaman arama yapacağına kendisinin karar vermesi fikrini akademik olarak temellendirdi; 2024'ten itibaren ise bu yaklaşım sektörde "agentic RAG" adıyla yaygınlaştı. Pratik kullanım alanları arasında kurumsal bilgi tabanı sorgulama, hukuki araştırma asistanları, tıbbi literatür analizi ve finansal rapor sentezi öne çıkar. Bu alanlarda uzun zincirli akıl yürütme gerektiren görevlerde geleneksel RAG'a kıyasla ölçülebilir bir doğruluk artışı gözlenir. Bedeli ise daha yüksek gecikme ve token maliyetidir; bu yüzden basit olgusal sorular için tek adımlı RAG hâlâ daha uygun bir tercihtir.

arrow_forward
tune

Bayesian Optimization (Bayesci Eniyileme)

Bayesian Optimization (Bayesci Eniyileme), gradient bilgisi olmadan ve fonksiyonun matematiksel formu bilinmeden, kara kutu niteliğindeki pahalı amaç fonksiyonlarını en az sayıda değerlendirmeyle optimize etmeye yarayan ileri bir arama yöntemidir. Temel fikir şudur: geçmiş değerlendirmelerden elde edilen bilgiyi bir olasılık modeline (vekil/surrogate model) aktarmak, ardından bu modeli kullanarak bir sonraki en umut verici noktayı akıllıca seçmek ve gereksiz denemelerden kaçınmak. Yöntem döngüsel ve sıralı biçimde çalışır. İlk olarak birkaç rastgele nokta değerlendirilir; elde edilen sonuçlar bir Gaussian Process (Gaussian Süreç) gibi probabilistik bir vekil modele fit edilir. Daha sonra bir kazanım fonksiyonu (acquisition function) — çoğunlukla Beklenen İyileşme (Expected Improvement, EI), Üst Güven Sınırı (Upper Confidence Bound, UCB) veya İyileşme Olasılığı (Probability of Improvement, PI) — vekil modelden hesaplanarak yeni bir aday nokta seçilir. Gerçek amaç fonksiyonu bu noktada değerlendirilir, ortaya çıkan sonuç modele eklenir ve döngü devam eder. Her iterasyonda vekil model daha isabetli hale gelir. Bayesian Optimization, özellikle derin öğrenme modellerinde hiperparametre optimizasyonu, otomatik makine öğrenmesi (AutoML) çerçeveleri ve sinir mimarisi arama (Neural Architecture Search, NAS) gibi her değerlendirmenin saatler sürebildiği senaryolarda Grid Search veya Random Search'e kıyasla büyük verimlilik avantajı sunar. Tipik olarak Random Search'e göre 5–10 kat daha az değerlendirmeyle benzer veya daha iyi sonuçlara ulaşılır. Popüler uygulamalar arasında Hyperopt, Optuna, SMAC ve Google Vizier yer almaktadır. Yöntemin başlıca sınırlılığı, Gaussian Process tabanlı vekil modelin yüksek boyutlarda hesaplama maliyetinin O(n³) ile artması ve doğası gereği sıralı işlem gerektirmesidir. Bu güçlükleri aşmak için Tree-structured Parzen Estimator (TPE), Random Forest tabanlı SMAC ve paralel değerlendirmeye uygun asenkron BO varyantları geliştirilmiştir.

arrow_forward
🔦

Beam Search Decoding (Işın Arama Kod Çözme)

Beam search decoding, otomatik çeviriden metin özetlemeye kadar geniş bir yelpazede kullanılan temel bir çıkarım algoritmasıdır. Greedy search her adımda yalnızca en yüksek olasılıklı tek tokeni seçerken; beam search 'ışın genişliği' (beam width, k) kadar hipotezi paralel biçimde takip eder. Her adımda mevcut k hipotezin her biri en olası devamlarıyla genişletilir, ortaya çıkan k×vocab_size aday arasından toplamda en yüksek log-olasılıklı k dizisi bir sonraki adım için korunur. Son token üretildiğinde (veya EOS tokeni görüldüğünde) en yüksek kümülatif olasılıklı dizi çıktı olarak döner. k=1 greedy search ile özdeştir; k arttıkça arama kalitesi artabilir ancak hesaplama ve bellek maliyeti de k katına çıkar. Algoritmanın temel zayıflığı, ham log-olasılık toplamının kısa dizileri kayırmasıdır: her ek token küçük bir negatif değer eklediğinden model kısa ve özlü çıktılar üretmeye yönelir. Bu sorunu gidermek için length penalty (uzunluk cezası) devreye girer; nihai skor dizinin uzunluğu üzerinden normalize edilir ve α parametresiyle ayarlanır, α değeri genellikle 0.6–1.0 arasında seçilir. Çeşitlilik gerektiren görevlerde ise diverse beam search, hipotezler arasına benzerlik cezası ekleyerek tekrarlayan ve birbiriyle örtüşen çıktı dizilerini azaltır. Modern büyük dil modelleri — GPT-4, Claude veya Llama-3 gibi — çoğunlukla beam search yerine greedy arama veya temperature/top-p örneklemeyi tercih eder. Otoregresif üretimde k paralel akışın GPU bellek gereksinimini k katına çıkarması, bunun yanı sıra yüksek kapasiteli modellerde kalite farkının belirgin biçimde azalması bu tercihin başlıca nedenleridir. Makine çevirisi (Google Translate, DeepL), otomatik konuşma tanıma (ASR/STT) ve metin özetleme gibi deterministik ve tekrarlanabilir çıktı gerektiren görevlerde beam search hâlâ endüstri standardıdır. Pratik bir boyutlandırma örneği: k=5 ile 30.000 token'lık sözlükte çalışan bir makine çevirisi modeli her üretim adımında 150.000 kombinasyonu değerlendirir; bu greedy search'e kıyasla yaklaşık 5× hesaplama yükü anlamına gelir. Buna karşın elde edilen BLEU artışı, özellikle kısa ve orta uzunluktaki cümlelerde bu ek maliyeti karşılar. 2015 yılında Sutskever ve ekibinin seq2seq mimarisiyle makine çevirisinde yaptığı çalışma, beam search'in NLP alanında geniş çapta benimsenmesine öncülük etmiştir.

arrow_forward
code_blocks

Bi-Encoder (Çift Kodlayıcı)

Bi-encoder (çift kodlayıcı), iki ayrı metin parçasını birbirinden bağımsız olarak kodlayan ve her birini sabit boyutlu bir vektör temsiline dönüştüren çift kule (two-tower) sinir ağı mimarisidir. Semantik arama, soru-cevap ve RAG sistemlerinin retrieval aşamasında temel yapı taşı olarak kullanılır; sorgu ile belge aynı vektör uzayında temsil edilir ve alaka düzeyi bu iki vektör arasındaki geometrik yakınlıkla ölçülür. Mimari genellikle ağırlıkları paylaşan iki transformer kulesinden oluşur ve bu yönüyle Siyam ağı (siamese network) ailesine girer. Sorgu ve belge ayrı ayrı işlenir; token çıktıları ortalama havuzlama (mean pooling) ya da [CLS] token'ı ile tek bir vektöre indirgenir. Benzerlik kosinüs benzerliği veya iç çarpımla hesaplanır. Belgeler korpus hazırlanırken bir kez kodlanır ve FAISS, pgvector ya da Milvus gibi vektör veritabanlarına indekslenir. Yeni bir sorgu geldiğinde yalnızca sorgu vektörü anlık üretilir; yaklaşık en yakın komşu (ANN) araması milisaniyeler içinde en yakın belgeleri döndürür. Bi-encoder'ın en kritik avantajı bu asimetrik hesaplama modelidir: milyonlarca belge için vektörler tek seferde üretilip saklanır, çevrimiçi gecikme yalnızca sorgu kodlamasını kapsar. Bu özellik onu büyük ölçekli üretim sistemleri için vazgeçilmez kılar. Doğruluk tarafında ise cross-encoder'ın gerisinde kalır. Cross-encoder sorgu-belge çiftini tek bir ileri geçişte birlikte işleyip token düzeyinde çapraz dikkat uygular; bu nedenle nüanslı anlam ilişkilerini daha iyi yakalar, ancak her çift için yeniden hesaplama gerektirir. Retrieve-then-rerank boru hattında bi-encoder ilk aşamada geniş bir aday kümesi getirir, cross-encoder ikinci aşamada bu adayları hassas biçimde yeniden sıralar. Eğitimde kontrastif öğrenme teknikleri kullanılır: MultipleNegativesRankingLoss (MNRL), triplet loss, in-batch negatives ve zor negatif madenciliği (hard negative mining). Sentence-BERT (SBERT, 2019) bu alanın öncü çalışmasıdır; Dense Passage Retrieval (DPR) yaklaşımı ise sorgu ve belge için ayrı kuleler kullanarak açık alan soru-cevap sistemlerinde standart haline gelmiştir. Günümüzde E5, BGE, GTE ve Nomic Embed gibi modeller MTEB kıyaslamalarında öne çıkar; multilingual-e5 ve bge-m3 gibi çok dilli sürümler Türkçe dahil onlarca dili destekler.

arrow_forward
code_blocks

Causal Discovery (Nedensel Keşif)

Nedensel keşif, yalnızca gözlemsel veriye bakarak değişkenler arasındaki nedensel ilişkilerin yapısını ortaya çıkarmaya çalışan bir makine öğrenmesi ve istatistik alanıdır. Temel çıktı genellikle yönlü döngüsüz bir çizge (DAG) biçimindedir; bu çizgede düğümler değişkenleri, oklar ise nedensel yönü temsil eder. Alanın köklü algoritmaları arasında PC algoritması (Peter-Clark) yer alır: koşullu bağımsızlık testleri yaparak önce bir iskelet çizgesi kurar, ardından v-yapılarını yönlendirerek Markov denklik sınıfını temsil eden bir kısmi yönlü döngüsüz çizgeye (CPDAG) ulaşır. FCI (Fast Causal Inference) algoritması ise gizli ortak nedenler bulunduğunda PC'nin yetersiz kaldığı durumlarda kullanılır ve gizli karıştırıcıları modelleyebilen PAG (Partial Ancestral Graph) yapılarını üretir. LiNGAM (Linear Non-Gaussian Acyclic Model), değişkenler arasındaki ilişkilerin doğrusal ve gürültünün Gauss dışı olduğunu varsayarak tek bir DAG'ı tanımlayabilir; bu varsayım, Gauss durumundaki tanımlanamama sorununu çözer. GES (Greedy Equivalence Search) denklik sınıfları üzerinde aç gözlü bir arama yürüterek skoru en çoklaştıran yapıyı bulur. 2019'da önerilen NOTEARS ise DAG'ı öğrenmeyi sürekli optimizasyon problemine dönüştürerek gradyan tabanlı yöntemlerle çözüme olanak tanır ve büyük ölçekli veri kümelerinde avantaj sunar. Nedensel keşif, nedensel çıkarımdan (causal inference) farklı bir problemi çözer: nedensel çıkarım yapı bilindiğinde belirli bir müdahalenin etkisini tahmin ederken, nedensel keşif o yapının kendisini veriden öğrenmeye çalışır. İkisi çoğu zaman birlikte kullanılır: önce keşif, sonra çıkarım. Uygulama alanları oldukça geniştir. Genomide gen düzenleyici ağları aydınlatmak, epidemiyolojide hastalık risk faktörlerini ayırt etmek, ekonomide politika etkilerini modellemek ve yapay zeka adalet çalışmalarında karar sistemlerindeki önyargı kaynaklarını tespit etmek bu alanların başında gelir. Alanın temel güçlükleri şunlardır: Markov denklik sınıfı problemi, yani birden fazla DAG'ın aynı gözlemsel dağılımı üretebilmesi; ölçülmemiş karıştırıcıların (confounders) varlığı; ve yeterli örneklem olmadığında koşullu bağımsızlık testlerinin güvenilirliğinin düşmesi. Tanımlanabilirlik (identifiability) kısıtlamaları hangi koşullar altında gerçek nedensel grafın kurtarılabileceğini belirler ve bu kısıtlamalar her durumda sağlanamaz.

arrow_forward
track_changes

Concept Drift Detection (Kavram Kayması Tespiti)

Concept drift detection (kavram kayması tespiti), makine öğrenmesi modellerinin üretim ortamında zamanla nasıl davrandığını izleyen ve giriş verilerinin ya da hedef değişkenin istatistiksel dağılımında meydana gelen kaymaları erken tespit eden bir MLOps tekniğidir. Bir model eğitildiğinde, belirli bir veri dağılımını temsil eden eğitim kümesi üzerinde optimize edilir. Ancak gerçek dünya koşulları değişkendir; kullanıcı davranışları, piyasa dinamikleri, çevresel faktörler veya sistem değişiklikleri nedeniyle veri dağılımı, modelin orijinal eğitim sürecinde öğrendiklerinden giderek uzaklaşabilir. Bu duruma kavram kayması denir ve model performansının bozulmasına yol açar. Kavram kaymasının üç temel türü vardır. Ani kayma (sudden drift), veri dağılımının kısa sürede dramatik biçimde değiştiği durumları tanımlar; COVID-19 salgınının e-ticaret alışkanlıklarını köklü biçimde dönüştürmesi buna örnek verilebilir. Kademeli kayma (gradual drift), eski veri dağılımının yavaş yavaş yenisiyle yer değiştirdiği geçiş süreçlerini kapsar. Tekrarlı kayma (recurring drift) ise daha önce görülmüş dağılım kalıplarının periyodik olarak yeniden ortaya çıktığı döngüsel durumları ifade eder. Popüler tespit algoritmaları arasında ADWIN (ADaptive WINdowing), DDM (Drift Detection Method), EDDM (Early Drift Detection Method) ve Page-Hinkley testi öne çıkar. ADWIN, geçmiş veri penceresini dinamik olarak boyutlandırarak istatistiksel sapmaları saptar. DDM ise model hatası oranını ve standart sapmasını izleyerek drift'i erken uyarıyla bildirir. MLOps pipeline'larında kavram kayması tespiti, modelin ne zaman yeniden eğitileceğini veya ince ayar yapılacağını belirleyen kritik bir karar mekanizmasıdır. Amazon SageMaker Model Monitor, Evidently AI, WhyLogs ve NannyML gibi araçlar bu süreci otomatikleştirerek mühendis ekibine zamanında uyarı gönderir. Erken tespit, iş kararlarını olumsuz etkileyebilecek sessiz model çürümesini (model decay) önlemenin temel yoludur. Özellikle finans, sağlık ve e-ticaret gibi dinamik ortamlarda bu teknik, güvenilir yapay zeka sistemlerinin sürdürülebilirliğini doğrudan destekler.

arrow_forward
code_blocks

Contrastive Loss (Karşıtlıklı Kayıp)

Contrastive loss (karşıtlıklı kayıp ya da karşılaştırmalı kayıp), gömme (embedding) modellerini eğitmek için kullanılan bir kayıp fonksiyonu ailesidir. Klasik sınıflandırma kayıpları modelin doğru sınıfı tahmin etmesini ödüllendirirken, contrastive loss örnekler arasındaki geometrik ilişkiyi hedefler: benzer örnek çiftleri gömme uzayında birbirine yaklaştırılır, farklı örnek çiftleri ise belirli bir marjın (margin) ötesine itilir. Böylece model, anlamsal benzerliği vektörler arasındaki uzaklıkla ifade etmeyi öğrenir ve elde edilen temsiller arama, eşleştirme ve sıfır atışlı sınıflandırma gibi görevlere doğrudan aktarılabilir. Yaklaşımın ilk biçimi Chopra, Hadsell ve LeCun tarafından 2005 yılında Siamese ağlarla birlikte önerildi. Bu formülasyonda pozitif çiftler için kayıp, iki gömme arasındaki Öklid uzaklığının karesine eşittir; negatif çiftler için ise uzaklık marjın altına düştüğünde ceza uygulanır, marjı aşan negatifler kayba katkı yapmaz. Triplet loss (2015, FaceNet) bu fikri üçlü örneklere taşır: bir çapa (anchor) örneğinin pozitifine olan uzaklığı, negatifine olan uzaklığından en az marj kadar küçük olmalıdır. Modern derin öğrenmede en yaygın kullanılan varyant InfoNCE'dir. Burada bir pozitif örnek, aynı mini yığındaki (batch) çok sayıda negatif ile birlikte softmax tabanlı bir sınıflandırma problemine dönüştürülür ve sıcaklık (temperature) parametresi dağılımın keskinliğini kontrol eder. SimCLR'ın NT-Xent kaybı, MoCo'nun momentum kuyruğu ve CLIP'in görüntü-metin eşleştirmesi bu formülasyonun farklı uygulamalarıdır. Etiketli veri mevcut olduğunda Supervised Contrastive Loss (SupCon), aynı sınıftaki tüm örnekleri pozitif kabul ederek daha sıkı sınıf kümeleri oluşturur. Pratikte contrastive loss'un başarısı üç etkene bağlıdır: pozitif çiftlerin nasıl üretildiği (veri artırma ya da etiket), negatiflerin sayısı ve zorluğu (hard negative mining) ile marj veya sıcaklık gibi hiperparametrelerin ayarı. Yüz tanıma, görsel arama, cümle gömme modelleri (Sentence-BERT, E5), öneri sistemleri ve çok modlu modeller bu kayıp ailesinin en görünür uygulama alanlarıdır.

arrow_forward
code_blocks

Cross-Encoder (Çapraz Kodlayıcı)

Cross-Encoder (Çapraz Kodlayıcı), bir sorgu ile bir belgeyi tek bir girdi dizisi olarak birleştirip aynı Transformer geçişinde işleyen ve ikili arasındaki alaka düzeyine doğrudan bir puan atayan yeniden sıralama (reranking) modelidir. Bi-encoder mimarisinde sorgu ve belge ayrı ayrı vektöre dönüştürülüp benzerlikleri kosinüs mesafesiyle ölçülürken, cross-encoder iki metni [SEP] tokenıyla birleştirir ve BERT ya da RoBERTa tabanlı bir kodlayıcıdan tek seferde geçirir. Bu düzenek, dikkat mekanizmasının sorgudaki her tokenı belgedeki her tokenla karşılaştırmasına izin verir; alaka puanı genellikle [CLS] tokenının temsili üzerine oturtulan küçük bir sınıflandırma katmanından elde edilir. Tarihsel olarak bu yaklaşım, 2019'da Nogueira ve Cho'nun MS MARCO pasaj sıralama görevinde BERT'i doğrudan sorgu-pasaj çiftleri üzerinde ince ayarlamasıyla yaygınlaştı. Sonradan "monoBERT" olarak anılan bu model, BM25'e göre MRR@10 metriğinde çarpıcı bir sıçrama gösterdi ve iki aşamalı arama mimarisinin standart parçası hâline geldi. Ardından Sentence-Transformers kütüphanesi CrossEncoder sınıfını ekleyerek bu modelleri birkaç satır Python koduyla kullanılabilir kıldı. Modern bilgi erişimi ve RAG (Retrieval-Augmented Generation) sistemlerinde cross-encoder, "retrieve-then-rerank" olarak adlandırılan iki aşamalı düzenin ikinci katmanında çalışır. Birinci aşamada BM25 ya da bir bi-encoder, milyonlarca belge arasından milisaniyeler içinde 50 ile 200 arasında aday getirir; ikinci aşamada cross-encoder bu küçük kümeyi sorguyla birlikte yeniden değerlendirip nihai sıralamayı belirler. Büyük dil modeline yalnızca en alakalı birkaç parçanın iletilmesi, halüsinasyon oranını düşürür ve bağlam penceresini verimli kullandırır. Temel avantajı, sorgu ile belge arasındaki ince bağlamsal etkileşimi tam dikkat matrisiyle yakalayabilmesidir. "Python nedir?" sorusu için "Python programlama dili" ile "piton yılanı" belgelerini ayırt etmek, iki metindeki ipuçlarını birlikte okumayı gerektirir; bağımsız vektörlerle çalışan bi-encoder bu ayrımı çoğu zaman kaçırır. Bedeli ise hesaplama maliyetidir: belgeler önceden indekslenemez, her sorgu-belge çifti için ayrı bir ileri geçiş gerekir ve 512 token sınırı uzun belgelerin parçalanmasını zorunlu kılar. Bu nedenle cross-encoder tüm katalog üzerinde değil, yalnızca daraltılmış aday kümesi üzerinde kullanılır. ms-marco-MiniLM-L-6-v2, BGE-Reranker-v2-m3 ve Cohere Rerank API günümüzde en yaygın tercih edilen uygulamalardır.

arrow_forward
code_blocks

Decision Tree (Karar Ağacı)

Karar ağacı (Decision Tree), gözetimli öğrenme (supervised learning) kategorisinde yer alan, hem sınıflandırma hem de regresyon problemleri için kullanılan temel bir makine öğrenimi algoritmasıdır. Veriyi, ağaç benzeri bir yapı oluşturarak ardışık karar kurallarına göre alt kümelere böler. Yapının her iç düğümü bir özellik üzerinde yapılan bir testi, her dal o testin olası sonucunu, her yaprak düğümü ise nihai tahmin değerini ya da sınıfı temsil eder. Algoritma, veriyi bölmek için en iyi özelliği seçerken genellikle iki ölçütten birini kullanır: **Gini safsızlığı** (CART algoritmasında) veya **Bilgi Kazanımı/Entropi** (ID3 ve C4.5 algoritmalarında). Gini safsızlığı, bir düğümdeki örneklerin ne ölçüde saf bir sınıfa ait olduğunu; bilgi kazanımı ise bölme işleminin belirsizliği ne kadar azalttığını ölçer. Her adımda safsızlığı en çok düşüren özellik seçilerek ağaç büyütülür. Karar ağaçlarının en büyük güçlü yönü **yorumlanabilirliğidir**: elde edilen kurallar, uzman olmayanlar tarafından bile kolayca anlaşılabilir grafiksel ağaçlara dönüştürülebilir. Bu özellik tıbbi teşhis, kredi risk değerlendirmesi ve sahtekârlık tespiti gibi alanlarda şeffaf karar sistemleri kurulmasına zemin hazırlar. Öte yandan tek bir ağaç, verideki küçük değişikliklere karşı aşırı duyarlı olabilir (yüksek varyans) ve derin büyürse aşırı öğrenme (overfitting) riski taşır. Bu sınırlılıkları aşmak için rastgele ormanlar (Random Forest) ve gradyan artırma (Gradient Boosting) gibi topluluk öğrenmesi yöntemleri geliştirilmiştir. Karar ağaçlarının bir diğer önemli avantajı, özellik ölçeklemesi gerektirmemesidir; sayısal ve kategorik veriler birlikte işlenebilir. Eğitim karmaşıklığı O(n log n) düzeyinde olup tahmin ise yalnızca O(derinlik) adımda tamamlanır. Scikit-learn kütüphanesi, CART algoritmasını temel alarak budama (pruning) ve çapraz doğrulama desteğiyle tam işlevsel bir uygulama sunar. Algoritmanın parametrik olmayan doğası, verinin herhangi bir istatistiksel dağılıma uymasını zorunlu kılmaz; bu da onu farklı veri yapılarına karşı esnek kılar.

arrow_forward
park

Decision Trees (Karar Ağaçları)

Karar ağaçları (decision trees), bir veri setini özellik değerlerine göre ardışık ikili bölmelere ayırarak sınıflandırma veya regresyon görevi gerçekleştiren yorumlanabilir makine öğrenmesi modelidir. Kök düğümden yaprak düğümlerine uzanan her dal bir karar kuralını, her yaprak ise bir tahmin değerini veya sınıf etiketini temsil eder. Karar ağacı eğitimi özyinelemeli ikili bölme algoritmasıyla çalışır. Her adımda tüm özellikler ve olası bölme noktaları değerlendirilir; en yüksek bilgi kazancı (information gain) veya en düşük Gini safsızlığı veren kombinasyon seçilerek düğüm bölünür. Bu işlem yaprak düğüm saf hâle gelene ya da önceden belirlenen maksimum derinliğe ulaşılana kadar tekrarlanır. Karar ağaçlarının en güçlü yanı yorumlanabilirliktir. Model her tahminini adım adım açıklayan doğal kural seti üretir; bir müşterinin kredi başvurusunun neden reddedildiğini "gelir 30.000 TL altı VE borç oranı 0.4 üstü" gibi sade mantıksal ifadelerle görmek mümkündür. Bu şeffaflık, GDPR ve yapay zeka şeffaflığı düzenlemeleri kapsamındaki görevlerde önemli bir avantaj sunar. Öte yandan sınırlandırılmamış karar ağaçları kolayca eğitim verisini ezberler; her yaprak tek bir örneği temsil eden aşırı derin bir ağaç oluşabilir. Minimum örnekle yaprak parametresi, maksimum derinlik kısıtı ve maliyet-karmaşıklık budaması bu soruna karşı temel çözüm araçlarıdır. Tek bir karar ağacının sınırlamalarını aşmak için topluluk (ensemble) yöntemleri geliştirilmiştir. Random Forest, her biri rastgele özellik alt kümesiyle eğitilen yüzlerce ağacın oy çokluğunu kullanır. Gradient Boosting yöntemleri olan XGBoost ve LightGBM ise hataları ardışık ağaçlarla düzelterek yapısal verili görevlerde çoğu zaman derin öğrenme modellerini geride bırakır. Karar ağaçları hem sayısal hem kategorik özelliklerle çalışabilir; ölçeklendirme gerektirmez ve aykırı değerlere karşı görece sağlamlıdır. Özellik önemi hesaplaması, modelin hangi değişkenlere ne ölçüde dayandığını sayısal olarak ortaya koyar ve veri analizi süreçlerinde yol gösterici bir araç işlevi görür.

arrow_forward
biotech

Evrimsel Algoritma (Evrimsel Algoritma)

Evrimsel algoritmalar, doğal seçilim, kalıtım ve genetik dönüşüm ilkelerinden ilham alan popülasyon tabanlı metasezgisel optimizasyon yöntemlerinin genel adıdır. Bu algoritmalar, bir dizi aday çözümden oluşan başlangıç popülasyonuyla çalışmaya başlar ve her nesilde bu popülasyonu değerleyerek, seçerek ve dönüştürerek daha iyi çözümlere doğru iteratif biçimde ilerler. Temel işleyiş döngüsü dört ana adımdan oluşur: Başlatma aşamasında rastgele ya da sezgisel yöntemle aday bireyler oluşturulur; her birey problemi temsil eden bir kodlamadır (bit dizisi, gerçek sayı vektörü veya program ağacı). Uygunluk değerlendirmesi (fitness evaluation) aşamasında her bireyin problemi ne kadar iyi çözdüğü sayısal olarak ölçülür. Seçilim operatörü, daha yüksek uygunluğa sahip bireyleri üremeye tercih ederek bilginin bir nesilden diğerine aktarılmasını sağlar. Son olarak çaprazlama ve mutasyon operatörleri yeni bireyler üretir; mutasyon arama uzayında çeşitliliği koruyarak erken yakınsamayı engeller. Döngü, belirlenen durdurma kriteri karşılanana kadar sürer. Evrimsel algoritmalar, gradyan tabanlı yöntemlerin yetersiz kaldığı senaryolarda güçlü alternatifler sunar: türev hesaplanamayan, ayrık veya çok-modlu amaç fonksiyonları, simülasyon tabanlı kara-kutu optimizasyonu ve NP-zor kombinatoryal problemler bu senaryoların başında gelir. Birden fazla bireyi paralel değerlendirme kapasitesi, çok çekirdekli ve dağıtık hesaplama ortamlarında önemli hız avantajı sağlar. Başlıca türler arasında Genetik Algoritmalar (GA), Kovaryans Matris Adaptasyonu (CMA-ES), Diferansiyel Evrim (DE), Genetik Programlama (GP) ve NEAT sayılabilir. 2006 yılında NASA'nın ST5 uydusunun anteni bu yöntemle tasarlanmış; geleneksel mühendislik yaklaşımlarını aşan, sezgisel-olmayan bir geometriye ulaşılmıştır. Yapay zeka alanında CMA-ES ve OpenAI ES, pekiştirmeli öğrenme politika aramasında gradyan iniş yöntemleriyle rekabet edebilecek düzeyde etkisini kanıtlamıştır. Hibrit yaklaşımlarda ise evrimsel algoritmalar genel bir arama yaparak iyi başlangıç noktaları belirler, ardından gradyan iniş yerel ince ayarı tamamlar.

arrow_forward
code_blocks

Expectation-Maximization Algorithm (Expectation-Maximization (EM) Algoritması)

Expectation-Maximization (EM) algoritması, gizli (latent) değişkenler içeren istatistiksel modellerde maksimum olabilirlik (MLE) veya maksimum sonsal (MAP) parametre tahminleri hesaplamak için kullanılan yinelemeli bir optimizasyon yöntemidir. Arthur Dempster, Nan Laird ve Donald Rubin'in 1977'de Journal of the Royal Statistical Society'de yayımladığı seminal çalışmayla sistematik olarak formüle edilmiştir. Algoritma iki temel adımdan oluşur: E-adımında (Expectation — Beklenti), mevcut parametre tahminleri kullanılarak gizli değişkenlerin koşullu beklentileri hesaplanır; Q fonksiyonu olarak adlandırılan bu beklenti, log-olabilirliğin alt sınırını oluşturur. M-adımında (Maximization — Maksimizasyon) ise Q fonksiyonunu maksimize eden yeni parametre tahminleri bulunur. Bu iki adım yakınsayana kadar tekrarlanır ve her yineleme modeli veriye biraz daha iyi uyacak şekilde günceller. EM'in en kritik matematiksel özelliği, her iterasyonda gözlemlenen verinin log-olabilirliğinin azalmayacağının Jensen eşitsizliğiyle garanti edilmesidir. Bu özellik algoritmayı istikrarlı kılar ve kesinlikle bir sabit noktaya ya da yerel optimuma yakınsayacağını güvence altına alır; ancak başlangıç noktasına duyarlılık nedeniyle bu noktanın global optimum olması garanti değildir. Bu sorunu hafifletmek için çoklu rastlantısal başlatma (random restarts) veya k-means++ başlatma stratejisi yaygın olarak kullanılır. Makine öğrenimi tarihindeki en etkili algoritmalardan biri olan EM, Gaussian Karışım Modelleri (GMM), Hidden Markov Models (HMM) için Baum-Welch algoritması, Gizli Dirichlet Tahsisi (LDA) gibi konu modelleri ve eksik veri senaryolarında parametre tahmininde yaygın biçimde kullanılmaktadır. K-means kümeleme algoritması, EM'in sert (hard) atama kullanan özel bir durumu olarak formüle edilebilir; GMM ise bu çerçevenin daha esnek ve olasılıksal genellemesidir. Derin öğrenme çağında da EM canlılığını korumaktadır. Yarı gözetimli öğrenmede, Varyasyonel Otokodlayıcıların (VAE) eğitiminde ve Beklenti Yayılımı (Expectation Propagation) gibi Bayesçi çıkarım yöntemlerinde EM'in olasılıksal çerçevesi temel taş olmaya devam etmektedir.

arrow_forward
psychology_alt

Few-Shot Learning (Az Örnekle Öğrenme)

Few-Shot Learning (Az Örnekle Öğrenme), bir yapay zeka modelinin çok az sayıda etiketli örnek kullanarak yeni bir görevi başarıyla öğrenebilme yeteneğini inceleyen makine öğrenimi paradigmasıdır. Geleneksel denetimli öğrenme algoritmaları güvenilir sonuçlar üretmek için binlerce hatta milyonlarca etiketli veri örneğine ihtiyaç duyarken, few-shot learning yalnızca birkaç örnekle (genellikle 2-10 arası) doğru tahminler yapabilmeyi hedefler. Bu yaklaşım özellikle etiketli veri toplamak için uzman insan emeği gerektiren tıbbi görüntü analizi, nadir dil çiftleri için otomatik çeviri ve yeni ürün kategorizasyonu gibi alanlarda kritik öneme sahiptir. Few-shot learning; model-agnostik meta-öğrenme (MAML), prototipal ağlar, ilişkisel ağlar ve eşleşme ağları gibi tekniklerle hayata geçirilir. Modern büyük dil modellerinde (LLM) few-shot yaklaşım, prompt içine birkaç girdi-çıktı çifti yerleştirerek modelin görevi bağlamdan çıkarmasını sağlar; bu tekniğe in-context few-shot prompting adı verilir. GPT-4, Claude ve Gemini gibi modeller, herhangi bir parametre güncellemesi gerektirmeden yalnızca birkaç örnek ile yeni görevlerde yüksek başarı oranlarına ulaşabilmektedir. Few-shot learning paradigmaları genellikle N-way K-shot formatında tanımlanır: N farklı sınıf, her sınıftan K eğitim örneği. 5-way 1-shot sınıflandırması, 5 yeni kategoriden her birinde yalnızca 1 örnek görerek doğru sınıflandırma yapmak demektir. Bu format, modelin genelleştirme kapasitesini standart ve ölçülebilir biçimde değerlendirmek için yaygın bir kıyaslama standardı hâline gelmiştir. Episodic training (bölümlü eğitim) yaklaşımında her eğitim döngüsü, destek kümesi ve sorgu kümesinden oluşan küçük bir mini görev simüle eder; bu yapı modelin görülmemiş sınıflara hızlı uyum becerisini doğrudan pekiştirir. Pratik kullanımda destek örneklerinin seçim kalitesi, sınıf temsili dengesi ve veri kaynaklı gürültü, few-shot sistem başarısını doğrudan etkileyen başlıca faktörler arasında yer alır. Kavram; hiç örnek gerektirmeyen zero-shot learning ile yüzlerce-binlerce örneğe ihtiyaç duyan fine-tuning arasında pratik bir orta yol sunar. Büyük ön-eğitimli modellerin yaygınlaşmasıyla birlikte few-shot yetenekler giderek artan önem kazanmaktadır.

arrow_forward
blur_on

Fuzzy Logic (Bulanık Mantık)

Bulanık mantık (fuzzy logic), 1965 yılında Lotfi Zadeh tarafından geliştirilen ve klasik Aristoteles mantığının ikili (doğru/yanlış) sınıflandırmasını sürekli bir üyelik derecesine genişleten matematiksel bir çerçevedir. Klasik küme teorisinde bir eleman ya kümeye aittir ya da değildir; bulanık kümede ise 0 ile 1 arasında herhangi bir üyelik derecesi alabilir. Bulanık mantığın temel kavramı bulanık kümeler ve üyelik fonksiyonlarıdır. 'Yüksek sıcaklık' gibi dilsel bir değişken için üçgen veya trapezoid biçimli bir üyelik fonksiyonu tanımlanır; örneğin 35°C 'yüksek sıcaklık' kümesine 0.7, 'çok yüksek sıcaklık' kümesine 0.3 derecesiyle üye olabilir. Bu belirsiz sınırlar gerçek dünyanın muğlak kavramlarını daha doğal biçimde modeller. Bulanık çıkarım sistemi üç aşamadan oluşur: bulanıklaştırma (fuzzification) kesin girdileri üyelik derecelerine dönüştürür; bulanık kural tabanı dilsel kurallarla ('EĞER sıcaklık yüksek VE nem çok fazla İSE fan hızı yüksek') çıkarım yapar; berraklaştırma (defuzzification) ise bulanık çıktıyı ağırlıklı ortalama gibi yöntemlerle kesin bir sayıya dönüştürür. Bulanık mantık, özellikle kesin matematiksel model kurmanın güç olduğu kontrol sistemlerinde güçlüdür. Çamaşır makinesi, klima, kamera otofokus ve metro sistemleri bulanık mantık kontrolörü kullanan yaygın ürünlere örnek verilebilir. Makine öğrenmesi öncesinde endüstriyel otomasyon ve karar destek sistemlerinde standart bir teknolojiydi. Günümüzde bulanık mantık, nöro-bulanık sistemler (neuro-fuzzy) aracılığıyla derin öğrenmeyle birleştirilmektedir. ANFIS (Adaptive Neuro-Fuzzy Inference System) gibi modeller hem yorumlanabilir kural tabanını hem de veriden öğrenme kapasitesini bir arada tutar. Python'da scikit-fuzzy kütüphanesi, MATLAB'da ise Fuzzy Logic Toolbox bu sistemi uygulamak için en yaygın araçlardır. Açıklanabilir yapay zeka (XAI) tartışmalarında bulanık mantığın şeffaf karar yapısı yeniden ilgi görmekte; tıbbi teşhis, finans riski ve gömülü kontrol sistemleri gibi alanlarda etkin biçimde kullanılmaktadır.

arrow_forward
code_blocks

Genetic Algorithm (Genetik Algoritma)

Genetik Algoritma (GA), biyolojik evrim ilkelerini — doğal seçilim, çaprazlama (crossover) ve mutasyon — bilgisayar optimizasyon problemlerine uygulayan, John Holland tarafından 1960'larda geliştirilen ve 1975 yılında "Adaptation in Natural and Artificial Systems" adlı kitabıyla sistematize edilen bir meta-sezgisel (metaheuristic) arama yöntemidir. Algoritma, her biri bir çözüm adayını temsil eden bireylerden oluşan bir popülasyonla başlar. Her birey, çözümün kodlanmış biçimi olan bir "kromozom" ile temsil edilir — geleneksel uygulamalarda bu ikili bit dizisidir, ancak modern uygulamalarda gerçel sayı vektörleri, permütasyonlar veya ağaç yapıları da kullanılır. Algoritmanın çekirdek döngüsü dört adımdan oluşur: (1) Uygunluk değerlendirmesi — her bireyin amaç fonksiyonuna göre puanlandırılması; (2) Seçim — yüksek uygunluklu bireylerin ebeveyn olarak tercih edilmesi (rulet tekerleği, turnuva veya sıralama seçimi gibi yöntemlerle); (3) Çaprazlama — iki ebeveynin kromozomlarının belirli bir noktadan birleştirilerek yavru üretilmesi; (4) Mutasyon — düşük olasılıkla rastgele gen değişikliği yapılarak yerel minimumdan kaçınma. Nesiller boyunca tekrar eden bu döngü, popülasyonu giderek daha iyi çözümlere doğru yönlendirir. Genetik Algoritmalar, gradyan tabanlı optimizasyon yöntemlerinin başarısız olduğu ayrık, çok modlu, çok boyutlu ve gürültülü problem uzaylarında güçlüdür. Geleneksel arama yöntemlerinin tıkandığı NP-zor problemlerde (gezgin satıcı problemi, çizelgeleme, ağ tasarımı) pratik çözümler üretir. Makine öğrenmesindeki uygulamaları arasında hiperparametre optimizasyonu, sinir ağı mimarisi arama (NAS — Neural Architecture Search) ve özellik seçimi öne çıkar. AutoML sistemleri, en iyi model konfigürasyonunu bulmak için evrimsel stratejileri kullanır. Bunun yanı sıra mühendislik tasarımı (aerodinamik optimizasyon, malzeme bilimi), lojistik (rota planlaması, kapasite optimizasyonu) ve biyoinformatik (protein katlama, gen ifadesi analizi) alanlarında yaygın kullanım bulur. Pratik uygulama için Python'da DEAP (Distributed Evolutionary Algorithms in Python) ve PyGAD kütüphaneleri kapsamlı API sunmaktadır. Genetik Programlama (GP), GA'nın bir uzantısı olup bireyleri sabit uzunluklu kodlar yerine program ağaçları olarak temsil eder ve sembolik regresyon gibi görevlerde kullanılır. Diferansiyel Evrim (Differential Evolution) ise sürekli uzaylar için optimize edilmiş yakın akraba bir yöntemdir.

arrow_forward
fingerprint

Genetic Algorithms (Genetik Algoritmalar)

Genetik Algoritmalar (GA), biyolojik evrimin temel mekanizmalarından — doğal seçilim, çaprazlama (crossover) ve mutasyon — ilham alarak tasarlanmış sezgisel arama ve optimizasyon algoritmalarıdır. 1975 yılında John Holland tarafından Michigan Üniversitesi'nde teorik temelleri atılan bu yaklaşım, özellikle gradyan tabanlı yöntemlerin yetersiz kaldığı karmaşık, çok boyutlu ve türevlenemeyen arama uzaylarında güçlü bir alternatif sunar. GA'nın çalışma prensibi beş temel adımdan oluşur: (1) Başlangıç popülasyonu — olası çözümleri temsil eden bireylerden (kromozomlardan) oluşan rastgele bir popülasyon oluşturulur; her birey genellikle binary bit dizisi, gerçek sayı vektörü veya permütasyon olarak kodlanır. (2) Uygunluk değerlendirmesi — her bireyin kalitesi, probleme özgü bir uygunluk (fitness) fonksiyonuyla ölçülür. (3) Seçilim — daha yüksek uygunluk değerine sahip bireyler ebeveyn olarak seçilme şansını artırır; rulet tekerleği, turnuva ve sıra-tabanlı seçim en yaygın stratejilerdir. (4) Çaprazlama — iki ebeveynin genetik materyali birleştirilerek yeni çocuk bireyler üretilir; tek nokta, iki nokta ve üniform çaprazlama popüler yöntemlerdir. (5) Mutasyon — küçük rastgele değişiklikler eklenerek genetik çeşitlilik korunur ve yerel optimumlara takılma riski azaltılır. Bu döngü, belirlenen nesil sayısına ulaşılana ya da uygunluk eşiği sağlanana dek tekrarlanır. Her nesilde popülasyon ortalama kalitesi artar; en iyi birey "elit seçim" stratejisiyle bir sonraki nesile doğrudan aktarılabilir (elitizm). Genetik Algoritmalar; makine öğrenmesinde hiperparametre optimizasyonu, lojistik rota planlaması (Gezgin Satıcı Problemi), elektronik devre tasarımı, protein katlama, oyun yapay zekası ve NAS (Neural Architecture Search) gibi geniş bir uygulama yelpazesine sahiptir. Simulated Annealing ve Parçacık Sürü Optimizasyonu (PSO) ile sıklıkla karşılaştırılır; GA'nın temel avantajı, paralel popülasyon keşfiyle çok-modlu fonksiyonlarda yerel optimumlardan kaçabilmesidir. Hesaplama maliyetinin yüksek olabileceği ve sonuçların deterministik olmadığı başlıca kısıtlamalar arasındadır.

arrow_forward
code_blocks

Genetic Programming (Genetik Programlama)

Genetic Programming (GP), genetik algoritmaların bir uzantısı olarak bireylerin sabit uzunluklu bit dizileri yerine yürütülebilir bilgisayar programları olduğu evrimsel bir hesaplama yöntemidir. John Koza tarafından 1992'de sistematik biçimde formüle edilen GP, doğal seleksiyonu programların yüksek seviyeli sembolleriyle çalışacak şekilde uyarlar. Her birey, tipik olarak ağaç veri yapısıyla temsil edilir: dallar aritmetik operatörler, mantıksal koşullar veya döngü yapıları gibi işlevleri, yapraklar ise sabitler ya da değişkenler (terminaller) içerir. Bir popülasyon başlatıldıktan sonra üç temel evrimsel operatör devreye girer. Seçim operatörü, bir değerlendirme fonksiyonuna göre en iyi bireyleri bir sonraki nesle taşır. Çaprazlama, iki ebeveyn ağacından rastgele seçilen alt ağaçların yer değiştirmesiyle hibrit çocuklar üretir. Mutasyon ise rastgele bir düğümü ya da alt ağacı yeniden oluşturarak keşif kapasitesini artırır. GP'nin en güçlü uygulama alanlarından biri sembolik regresyondur: gözlem verilerinden en uygun matematiksel denklemi otomatik olarak türetir. Bu yaklaşım, fizik ve mühendislik verilerinden anlamlı denklemler çıkarmak için kullanılır; örneğin PySR kütüphanesi Feynman denklemlerini otomatik olarak yeniden keşfetmiştir. Bunların yanı sıra GP; FPGA devre tasarımı, robotik hareket planlama, oyun stratejisi öğrenme ve yazılım hata onarımı gibi alanlarda da geniş kullanım bulur. Önemli bir dezavantaj bloat sorunudur: nesiller ilerledikçe programlar gereksiz kod parçalarıyla şişer ve hesaplama maliyeti artar; bunu önlemek için ağaç boyutu sınırlamaları veya parsimony pressure (boyut cezası) eklenir. Modern varyantlar arasında Grammatical Evolution (BNF gramerleriyle arama uzayını kısıtlar), Linear Genetic Programming (ağaç yerine doğrusal talimat dizileri kullanır) ve Strongly-Typed GP (tür güvenliğini zorlayan uzantı) yer alır. Derin öğrenme çağında GP, differansiyellenebilir GP ve nöral ağlarla hibrit mimarilerde yeniden ilgi görmekte; AutoML ve NAS (Neural Architecture Search) araştırmalarıyla kesişmektedir.

arrow_forward
code_blocks

Gradient Boosting (Gradyan Artırma)

Gradient Boosting (Gradyan Artırma), makine öğreniminde zayıf öğrenicileri art arda sıralı biçimde ekleyerek güçlü ve yüksek doğruluklu bir tahmin modeli oluşturan bir topluluk öğrenme algoritmasıdır. Random Forest gibi diğer topluluk yöntemlerinin ağaçları paralel olarak eğitmesinin aksine, Gradient Boosting her yeni ağacı bir önceki modelin kalan hatasını (artık değer, residual) azaltacak şekilde sıralı olarak inşa eder. Algoritmanın çalışma mantığı şu adımlarla özetlenebilir: İlk adımda verilen hedef değer için basit bir temel tahmin yapılır; bu genellikle ortalama değerdir. Sonraki adımda mevcut tahmin ile gerçek değer arasındaki farklar (artık değerler) hesaplanır. Bir sonraki karar ağacı bu artık değerleri tahmin etmek üzere eğitilir. Yeni ağacın katkısı, aşırı öğrenmeyi önlemek için öğrenme hızı (learning rate) parametresiyle ölçeklendirilerek mevcut modele eklenir. Bu döngü, belirlenen ağaç sayısına ulaşılana kadar tekrar eder; her yinelemede model bir öncekinin en zayıf noktasına odaklanır. Gradient Boosting'in matematiksel temeli gradyan iniş (gradient descent) optimizasyonuna dayanır. Ağaçlar, seçilen kayıp fonksiyonunu minimize edecek şekilde gradyan yönünde oluşturulur; bu yapı, algoritmanın regresyon, sınıflandırma ve sıralama gibi farklı problem tiplerine kolayca uyarlanmasını sağlar. Algoritmanın en belirgin avantajı, tablolar halindeki yapısal veriyle (structured/tabular data) olağanüstü yüksek doğruluk sağlamasıdır. Kaggle yarışmalarında yıllardır zirvede yer alan bu aile, XGBoost, LightGBM ve CatBoost gibi modern kütüphanelerle bellek ve hız açısından da optimize edilmiştir. XGBoost level-wise (satır bazlı) ağaç büyümesiyle daha kararlı sonuçlar üretirken LightGBM ise leaf-wise (yaprak bazlı) büyüme ve histogram tabanlı bölme ile büyük veri setlerinde çok daha hızlı çalışır. Dezavantajları arasında aşırı öğrenmeye (overfitting) yatkınlık, hiperparametre ayarının (n_estimators, learning_rate, max_depth, min_samples_split) hassasiyeti ve büyük veri setlerinde paralel eğitimin zorluğu sayılabilir. Öğrenme hızı düşük ve ağaç sayısı yüksek tutulduğunda daha genelleştirilebilir modeller elde edilir; ancak bu dengenin bulunması kapsamlı çapraz doğrulama (cross-validation) gerektirir.

arrow_forward
code_blocks

Hidden Markov Model (Gizli Markov Modeli)

Hidden Markov Model (Gizli Markov Modeli — HMM), gözlemlenemeyen (gizli) durumlar arasındaki olasılıksal geçişleri ve bu durumların ürettiği gözlemleri modelleyen bir olasılıksal grafik modelidir. "Markov" özelliği, bir sonraki durumun yalnızca mevcut duruma bağlı olduğunu; geçmiş tüm durumlardan bağımsız olduğunu ifade eder. "Gizli" sözcüğü ise gerçek sistem durumlarının doğrudan gözlemlenemeyip yalnızca bu durumların ürettiği semboller ya da sinyaller aracılığıyla çıkarsanabileceğini belirtir. Matematiksel olarak HMM beş bileşenden oluşur: gizli durum kümesi S, gözlem sembol kümesi O, durum geçiş olasılıkları matrisi A (A[i][j] = i durumundan j durumuna geçiş olasılığı), yayılım (emission) olasılıkları matrisi B (B[j][k] = j durumundayken k sembolünü yayma olasılığı) ve başlangıç durum dağılımı π. HMM'e yönelik üç temel hesaplama problemi vardır. İlki değerlendirme (evaluation): verili gözlem dizisi için modelin bu diziyi üretme olasılığını hesaplamak; İleri Algoritma (Forward Algorithm) bu problemin verimli çözümüdür. İkincisi çözümleme (decoding): verili gözlem dizisine en olası gizli durum dizisini bulmak; Viterbi Algoritması dinamik programlama ile bu görevi O(N²T) süre karmaşıklığıyla çözer. Üçüncüsü öğrenme (learning): gözlem verilerinden A, B ve π parametrelerini tahmin etmek; Baum-Welch Algoritması, Beklenti-Maksimizasyon (EM) çerçevesinde bu görevi yerine getirir. Tarihsel olarak HMM, 1970'lerde otomatik konuşma tanıma (ASR) sistemlerinin temel taşı oldu: akustik model olarak her fonem bir HMM durumuna karşılık gelirken Viterbi algoritması en olası fonem dizisini çözümler. Ayrıca POS (part-of-speech) etiketleme, biyoinformatik (gen dizisi analizi), jest ve el yazısı tanıma ile finansal zaman serisi modellemesinde yaygın biçimde kullanılmıştır. Derin öğrenme çağında RNN ve Transformer mimarileri büyük ölçüde HMM'nin yerini almıştır; ancak HMM yorumlanabilirliği, gizli durum ayrımı ve küçük veri senaryolarındaki avantajlarını korumaktadır. Modern ASR sistemlerinde CTC-HMM hibrit mimarileri hâlâ üretimde kullanılmakta; kaldi ve ESPnet gibi araç setleri bu yaklaşımı desteklemektedir. Türkçe konuşma tanıma araştırmalarında HMM tabanlı akustik modeller akademik çalışmalarda referans noktası olma özelliğini sürdürmektedir.

arrow_forward
account_tree

Hierarchical Clustering (Hiyerarşik Kümeleme)

Hiyerarşik kümeleme (hierarchical clustering), veri noktaları arasındaki benzerlik ilişkilerini kullanarak hiyerarşik bir yapı oluşturan denetimsiz öğrenme algoritmasıdır. K-means gibi yöntemlerin aksine, küme sayısını önceden belirlemeyi gerektirmez; bunun yerine tüm veri seti tek bir kümeden başlanarak alt gruplara bölünür ya da bireysel noktalardan başlanarak büyük kümelere birleştirilir. İki temel yaklaşım bulunur. Agglomeratif (birleştirici, aşağıdan yukarı) yöntemde her veri noktası başlangıçta ayrı bir küme kabul edilir; algoritma adım adım en yakın çiftleri birleştirir ve sonunda tek bir büyük kümeye ulaşır. Bu süreç bir ağaç diyagramında — dendrogramda — görselleştirilir. Bölücü (divisive, yukarıdan aşağı) yöntemde ise tüm veri kümesi tek bir gruptan başlar ve tekrarlı bölümlerle alt kümelere ayrılır. Pratikte agglomeratif yöntem çok daha yaygın kullanılmaktadır. Kümeler arasındaki mesafeyi ölçmek için bağlantı kriteri (linkage criterion) seçilir. Tek bağlantı (single linkage) iki kümenin birbirine en yakın noktaları arasındaki mesafeyi kullanır; zincir etkisine (chaining) yatkındır. Tam bağlantı (complete linkage) en uzak noktaları; ortalama bağlantı (average linkage) tüm nokta çiftlerinin ortalama mesafesini kullanır. Ward bağlantısı ise birleştirme sonrası küme içi toplam karesel sapma artışını minimize eder ve genel amaçlı kullanımda dengeli, kompakt kümeler ürettiği için en sık tercih edilen kriterdir. Dendrogramda belirli bir yükseklikte yatay bir kesim çizgisi çekerek istenilen küme sayısına ulaşılır; bu özellik algoritmayı keşifsel veri analizinde değerli kılar. Algoritmanın hesaplama karmaşıklığı naif uygulamada O(n³), bellek kullanımı O(n²) düzeyindedir; bu durum büyük veri kümelerinde ölçeklenebilirliği kısıtlar. Yaklaşık yöntemler ve BIRCH gibi özel algoritmalar bu sorunu kısmen gidermektedir. Biyoinformatik (gen ifadesi analizi, protein sekans sınıflandırması), belge kümeleme, müşteri segmentasyonu, piyasa sepet analizi ve anomali tespiti başlıca uygulama alanları arasındadır. Python'da scipy.cluster.hierarchy ve sklearn.cluster.AgglomerativeClustering modülleriyle kolayca uygulanır; dendrogramlar matplotlib ile görselleştirilebilir. Sonuçlar, kümeleme kalitesini ölçmek için Silhouette skoru veya Cophenetic korelasyon katsayısıyla değerlendirilir.

arrow_forward
rotate_left

Inverse Reinforcement Learning (IRL) (Ters Pekiştirmeli Öğrenme)

Inverse Reinforcement Learning (IRL), ya da Türkçesiyle Ters Pekiştirmeli Öğrenme, standart Pekiştirmeli Öğrenmenin (RL) tersine çalışan bir makine öğrenmesi paradigmasıdır. Klasik RL'de bir ajan, önceden tanımlanmış bir ödül fonksiyonu aracılığıyla geri bildirim alarak politika öğrenir. IRL ise bu süreci ters çevirir: elimizde uzman davranışları (demonstrasyon trajektörleri) bulunur ve bu davranışlardan söz konusu davranışı motive eden ödül fonksiyonu çıkarılır. Yöntemin temel motivasyonu, gerçek dünya problemlerinde ödül fonksiyonu tasarlamanın son derece güç olmasından kaynaklanır. Otonom araç sürüşünde "güvenli ve konforlu" davranışı sayısal olarak ifade etmek, cerrahi robotlara hassas el hareketleri öğretmek ya da diyalog sistemlerinde "kibar ve yardımsever" yanıtları tanımlamak birbirinden zor görevlerdir. IRL, bu karmaşık ödül tasarımı sorununu, uzman demonstrasyonlarından ödülü öğrenerek dolaylı yoldan çözer. IRL'in üç temel algoritma ailesi vardır. Maximum Entropy IRL, olası politikalar arasında bilgi teorisi kapsamında maksimum entropiyi seçerek belirsizliği ilkesel biçimde ele alır; otonom sürüş yol planlamasında yaygın kullanım bulmuştur. GAIL (Generative Adversarial Imitation Learning), GAN mimarisini taklit öğrenmeye uygular: ayırt edici ağ uzman ile ajan davranışını birbirinden ayırt etmeye çalışırken politika ağı bunu engellemeye çalışır. Bayesian IRL ise ödül fonksiyonu üzerinde olasılık dağılımı tutarak modelin kendi belirsizliğini de ifade etmesini sağlar; bu özelliği güvenli sistemler tasarımı için kritik öneme sahiptir. IRL, RLHF (Reinforcement Learning from Human Feedback) yönteminin doğrudan öncülüdür. Büyük dil modellerinde uygulanan RLHF, insan tercih karşılaştırmalarından (A mı B mi daha iyi?) bir ödül modeli öğrenir ve bu modeli RL politikasını ince ayarlamak için kullanır; bu yaklaşım IRL'in pratik bir biçimidir. GPT-4, Claude ve benzeri modeller bu paradigmayla eğitilmiştir. Yöntemin başlıca zorlukları şunlardır: uzman demonstrasyonu toplamak pahalı ve zaman alıcıdır; gözlemlenen bir davranışı açıklayan birden fazla ödül fonksiyonu bulunabilir (belirsizlik sorunu); hesaplama maliyeti standart RL'e kıyasla yüksektir. Bununla birlikte IRL, AI hizalama araştırmasının temel araçlarından biri olmaya devam etmektedir: insan değerlerini gözlemden matematiksel olarak çıkarma hedefi, güvenli ve uyumlu yapay zeka sistemleri inşasında kritik öneme sahiptir.

arrow_forward
bubble_chart

K-Means Clustering (K-Ortalamalar Kümeleme)

K-Means Kümeleme (K-Ortalamalar), denetimsiz makine öğreniminin en yaygın algoritmasıdır; etiketsiz bir veri kümesini önceden belirlenen K adet gruba (kümeye), her veri noktasını en yakın merkeze (centroid) atayarak böler. Algoritma 1950'lerin sonunda Stuart Lloyd tarafından geliştirilmiş, James Mac-Queen tarafından 1967'de "K-Means" adıyla resmileştirilmiştir. Çalışma adımları dörde indirgenir. Birinci adımda K adet merkez nokta rastgele ya da K-Means++ yöntemiyle akıllıca seçilir. İkinci adımda her veri noktası, Öklidyen uzaklık hesabıyla en yakın merkeze atanır. Üçüncü adımda her kümenin merkezi, üye noktaların koordinat ortalaması alınarak güncellenir. Merkezler değişmeyene veya iterasyon limiti dolana kadar bu adımlar tekrarlanır; algoritma yerel minimumda yakınsar. K değerinin seçimi algoritmanın en kritik adımıdır. "Dirsek Yöntemi" (Elbow Method), farklı K değerleri için küme içi kareler toplamını (WCSS) hesaplar; eğrinin belirgin dirsek oluşturduğu nokta optimal K'yı işaret eder. Silüet Skoru ise her noktanın kendi kümesine ne kadar sıkı bağlı olduğunu ölçerek -1 ile +1 arasında bir kalite puanı üretir. Ayrıca Bayesian Bilgi Kriteri (BIC) ve Gap İstatistiği de sık kullanılan yöntemler arasındadır. Gerçek dünya uygulamaları geniş bir yelpazeye yayılır: e-ticarette müşteri segmentasyonu, haber platformlarında belge kümeleme, görüntü işlemede renk niceleme (pikselleri K renge indirme), biyoinformatikte gen ekspresyon analizi ve anomali tespiti bunların başında gelir. Amazon ve Netflix, kullanıcı davranışlarını analiz etmek için K-Means tabanlı segmentasyon yöntemlerinden yararlanmaktadır. Algoritmanın temel sınırlamaları şunlardır: küre dışı geometriler (hilal, iç içe geçmiş kümeler) için yetersiz kalması, aykırı değerlere duyarlılık ve K'nın önceden belirlenmesi zorunluluğu. Bu durumlar için DBSCAN (gürültü toleranslı, şekle bağımsız), GMM - Gauss Karışım Modeli (olasılıksal üyelik) veya hiyerarşik kümeleme (K gerektirmez) alternatif olarak tercih edilebilir.

arrow_forward
🐜

Karınca Kolonisi Optimizasyonu (ACO) (Karınca Kolonisi Optimizasyonu)

Karınca Kolonisi Optimizasyonu (ACO), Marco Dorigo tarafından 1992 yılındaki doktora tezinde geliştirilen, karıncaların feromon izi bırakarak yiyecek kaynağına en kısa yolu bulma davranışını matematiksel olarak modelleyen meta-sezgisel bir optimizasyon algoritmasıdır. Biyolojik karıncalar, kısa güzergahlarda daha sık geçiş yaptığından bu yollarda feromon birikimi artar; uzun yollardaki feromon ise zamanla buharlaşarak solar. Bu olasılıksal mekanizma, koloniyi zamanla global optimuma yakınsatır. Algoritmada her iterasyonda bir grup sanal "yapay karınca" çözüm uzayını keşfeder. Her karınca, mevcut feromon yoğunluğunu ve sezgisel bilgiyi (örn. kenar uzunluğunu) birleştiren stokastik bir kuralla hareket kararları verir. İterasyon tamamlandığında iyi çözümler bulan karıncalar feromonlarını biriktirir; tüm güzergahlardaki feromonlar ρ (rho) buharlaşma katsayısıyla kısmi olarak azalır. Birikim ve buharlaşma dengesi, hem umut verici bölgeleri yoğun araştırmayı hem de yeni alanları keşfetmeyi olanaklı kılar. Temel varyantlar arasında Ant Colony System (ACS, 1997) yerel feromon güncellemesi ve yalnızca küresel en iyi yolun güncellenmesiyle daha hızlı yakınsama sunar; MAX-MIN Ant System (MMAS) feromon değerlerini belirlenen alt ve üst sınırlar arasında tutarak erken yakınsamayı engeller; Rank-Based AS (ASrank) ise yalnızca sıralı en iyi karıncaların feromon bırakmasına izin verir. ACO, Gezgin Satıcı Problemi (TSP), Araç Rota Planlama (VRP), makine çizelgeleme, internet paketi yönlendirme (AntNet protokolü) ve protein katlama gibi kombinatoryal optimizasyon görevlerinde yaygın olarak kullanılır. Hibrit ACO-Derin Öğrenme modelleri büyük ölçekli lojistik ve enerji şebekesi optimizasyonunda aktif araştırma konusudur. Marco Dorigo, ACO ve sürü zekası alanındaki katkılarıyla 2022 IEEE Frank Rosenblatt Ödülü'nü almıştır. Güçlü yanları arasında dinamik ve çok modlu arama uzaylarında etkinliği, paralel uygulamaya uygunluğu ve yerel optimum tuzaklarından çıkma kapasitesi yer alır. Sınırlılıkları ise sürekli fonksiyon optimizasyonuna kısıtlı uyumu ve α, β, ρ hiperparametrelerinin problem bazında hassas ayar gerektirmesidir.

arrow_forward
scatter_plot

KNN (K-En Yakın Komşu) (K-En Yakın Komşu Algoritması)

KNN (K-En Yakın Komşu), yeni bir veri noktasını eğitim setindeki en yakın K komşusuna bakarak sınıflandıran veya sayısal değer tahmin eden denetimli bir makine öğrenimi algoritmasıdır. 1951'de Evelyn Fix ve Joseph Hodges'ın ABD Hava Kuvvetleri için hazırladığı raporla ortaya çıkan yöntem, 75 yılı aşkın süredir hem ders kitaplarının hem de gerçek üretim sistemlerinin vazgeçilmezi olmayı sürdürüyor. Algoritmanın mantığı günlük sezgiyle örtüşür: bir şeyin ne olduğunu bilmiyorsanız, ona en çok benzeyen örneklere bakarsınız. K=5 seçildiyse, yeni noktaya en yakın 5 eğitim örneği bulunur; sınıflandırmada bu 5 komşunun çoğunluk oyu, regresyonda ise değerlerinin (isteğe bağlı mesafe ağırlıklı) ortalaması sonucu belirler. KNN "tembel öğrenme" (lazy learning) ailesindendir: eğitim aşamasında model kurmaz, veriyi olduğu gibi bellekte tutar ve tüm hesabı tahmin anına erteler. Eğitim maliyeti fiilen sıfırdır; buna karşılık her tahmin, n örnek ve d boyut için O(n·d) mesafe hesabı gerektirir. Aynı zamanda non-parametriktir: veri dağılımı hakkında hiçbir varsayım yapmaz, karar sınırının şeklini doğrudan veriden okur. Mesafe ölçümünde en yaygın tercih Öklid mesafesidir; Manhattan, Minkowski, cosine benzerliği ve kategorik veri için Hamming mesafesi de kullanılır. Özellik ölçekleri farklıysa min-max normalizasyonu veya z-skoru standartlaştırması şarttır; aksi hâlde 0–1000 aralığındaki bir özellik, 0–1 aralığındakini tamamen bastırır. K seçimi bias-variance dengesini belirler: K=1 gürültüye aşırı duyarlıdır ve overfitting üretir, çok büyük K karar sınırını körleştirir. Pratikte K, çapraz doğrulama ile tek sayılar arasından seçilir; √n kuralı iyi bir başlangıç noktasıdır. KNN'in mesafe temelli çekirdeği, 2026'nın en güncel yapay zeka mimarilerinde de yaşıyor: RAG sistemlerindeki vektör araması, özünde embedding uzayında yürütülen bir yaklaşık en yakın komşu (ANN) sorgusudur. FAISS, HNSW tabanlı indeksler ve Pinecone, Weaviate, Qdrant, Milvus gibi vektör veritabanları milyarlarca vektör üzerinde milisaniyeler içinde komşu arayarak bu klasik fikri LLM çağının bel kemiği hâline getirdi. Scikit-learn tarafında KNeighborsClassifier ve KNeighborsRegressor sınıfları algoritmayı KD-Tree ve Ball Tree hızlandırmalarıyla birlikte sunar.

arrow_forward
code_blocks

Link Prediction (Bağlantı Tahmini)

Bağlantı tahmini (İng. link prediction), graflar ve ağ yapılarındaki mevcut olmayan ya da gelecekte kurulacak kenarları öngörmeye yönelik bir makine öğrenimi ve veri madenciliği görevidir. Temel soru şudur: "Bu iki düğüm arasında bir bağlantı oluşacak mı?" Sosyal ağlarda arkadaş önerisi, bilgi graflarında eksik ilişkilerin tamamlanması, biyomedikal ağlarda protein-protein etkileşimlerinin keşfi, öneri sistemlerinde ürün birlikteliği analizi ve siber güvenlikte şüpheli bağlantı örüntülerinin tespiti bu görevin başlıca uygulama alanlarıdır. Geleneksel yaklaşımlar yerel komşuluk benzerliğine dayanır. Ortak Komşu (Common Neighbors) yöntemi, iki düğümün paylaşılan komşu sayısını bağlantı skoru olarak kullanır. Jaccard katsayısı bu değeri komşu kümelerinin birleşimine bölerek normalize eder. Adamic-Adar skoru ise az dereceye sahip ortak komşulara daha yüksek ağırlık atayarak bilgi-teorik bir perspektif ekler. Katz Index, iki düğüm arasındaki tüm yolları üstel sönerek ağın küresel yapısını yakalar ve yerel yöntemlere kıyasla daha kapsamlı bir bağlantı skoru üretir. Bu yöntemler yorumlanabilir olmakla birlikte kenar semantiğini doğrudan yakalayamaz. Gömme tabanlı yöntemler bu açığı kapatır. Node2Vec, BFS ve DFS stratejilerini harmanlayan rastgele yürüyüşlerle düğümleri düşük boyutlu latent uzaya yerleştirir. Bilgi grafları için TransE, RelE ve RotatE gibi ilişki gömme modelleri eksik üçüzleri (özne, ilişki, nesne) tamamlamada kullanılır ve kenar semantiğini doğrudan öğrenir. Bu modeller, büyük bilgi tabanlarındaki yüz milyonlarca üçüzü kompakt vektörlerle temsil ederek hızlı çıkarım yapar. Graf Sinir Ağları (GNN), bağlantı tahminini uçtan uca öğrenilebilir bir göreve dönüştürmüştür. GraphSAGE rastgele komşuluk örneklemesiyle bellek verimliliği sağlar; GAT (Graph Attention Network) dikkat mekanizmasıyla komşulara diferansiyel ağırlık atar; SEAL çerçevesi ise yerel alt grafları doğrudan kenar sınıflandırması için eğitir. Başarım değerlendirmesinde AUC-ROC, Hits@K ve MRR (Ortalama Karşılıklı Sıra) metrikleri standart olarak kullanılır. Büyük dil modelleri de bilgi grafı tamamlama görevlerinde bağlantı tahmininden yararlanarak yapısal bilgiyi nöral akıl yürütmeyle birleştirmektedir. PyTorch Geometric ve Deep Graph Library, bu modellerin hızla prototiplenmesini mümkün kılan açık kaynak araç takımlarıdır.

arrow_forward
memory

Mamba (Mamba)

Mamba, 2023 yılında Carnegie Mellon Üniversitesi'nden Albert Gu ve Princeton Üniversitesi'nden Tri Dao tarafından yayımlanan 'Mamba: Linear-Time Sequence Modeling with Selective State Spaces' makalesiyle tanıtılan, Transformer mimarisine güçlü bir alternatif sunan dizi modelleme yaklaşımıdır. Geleneksel Transformer'lar, dizi içindeki her iki token çifti arasında dikkat (attention) hesaplaması yaparak O(n²) zaman ve bellek karmaşıklığı üretir. Bu, dizi uzunluğu arttıkça bellek gereksinimini katlanarak büyütür ve çok uzun bağlamları (örneğin 100.000 token) pratik olarak işlemeyi güçleştirir. Mamba bu sorunu temel düzeyde farklı bir yaklaşımla çözer: giriş dizisini gizli bir durum vektörü (hidden state) üzerinden ardışık olarak işleyen Seçici Durum Uzayı Modellerini (Selective State Space Models — S4/SSM) benimseyerek O(n) doğrusal karmaşıklıkla çalışır. Mamba'nın önceki durum uzayı modellerinden temel farkı 'seçicilik' (selectivity) mekanizmasıdır. Klasik SSM'lerde A, B, C geçiş matrisleri sabit parametrelerdir ve girişten bağımsız aynı dönüşümü uygularlar. Mamba'da ise bu parametreler her giriş tokenine göre dinamik biçimde hesaplanır: model, o andaki token değerine bakarak hangi bilginin gizli duruma yazılacağına, hangisinin unutulacağına her adımda ayrı ayrı karar verebilir. Bu esneklik sayesinde model hem kısa bağımlılıkları hem de çok uzak konumlardaki uzun bağımlılıkları (long-range dependencies) başarıyla yakalayabilmektedir. Donanım verimliliği açısından Mamba özgün bir çözüm sunar. Eğitim sırasında paralel tarama (parallel scan) algoritması kullanarak GPU'ların yoğun paralel hesaplama kapasitesinden yararlanır. Çıkarım (inference) aşamasında ise gizli durum boyutu sabit kaldığından bellek gereksinimi dizinin uzunluğuyla artmaz — bu özellik özellikle çok uzun bağlamlarda (100K+ token) belirleyici bir avantaj sağlar. Mamba mimarisi dil modellemesinden biyoinformatiğe, ses sinyali işlemeden zaman serisi tahminlemeye kadar geniş bir yelpazede uygulanmaktadır. AI21 Labs'ın Jamba modeli, Mamba ve Transformer katmanlarını hibrit biçimde birleştirerek her iki yaklaşımın güçlü yönlerinden yararlanan önemli bir örnek oluşturmuştur. Araştırmalar, benzer parametre sayısına sahip Transformer modelleriyle kıyaslandığında Mamba'nın özellikle uzun dizi senaryolarında verimlilik avantajının belirginleştiğini ve bazı görevlerde rekabetçi kalite sonuçları ürettiğini ortaya koymaktadır.

arrow_forward
route

Markov Decision Process (MDP) (Markov Karar Süreci)

Markov Karar Süreci (Markov Decision Process — MDP), pekiştirmeli öğrenmenin matematiksel temelini oluşturan karar teorisi çerçevesidir. MDP, bir ajanın (agent) olası durumlar (states), eylemler (actions), geçiş olasılıkları (transition probabilities) ve ödüller (rewards) aracılığıyla stokastik bir çevreyle etkileşimini formalize eder. Bir MDP dört temel bileşenden oluşur: S (durum uzayı), A (eylem uzayı), P(s'|s,a) (durum geçiş olasılıkları) ve R(s,a) (anlık ödül fonksiyonu). Buna ek olarak bir gamma (γ) indirim faktörü, gelecekteki ödüllerin mevcut değerini belirler. Markov özelliği, bir sonraki durumun yalnızca mevcut duruma ve seçilen eyleme bağlı olduğunu, geçmiş tarih bilgisine gerek olmadığını ifade eder. Bu özellik hesaplamayı büyük ölçüde basitleştirir ve çözüm algoritmalarının pratik uygulanabilirliğini garanti eder. MDP'nin çözümü, beklenen toplam ödülü en üst düzeye çıkaran bir politika (policy) π: S → A bulmayı gerektirir. Bellman optimality denklemleri, bu politikayı bulmak için temel matematiksel araçları sunar. Değer iterasyonu (value iteration) ve politika iterasyonu (policy iteration) algoritmaları, sonlu ve küçük durum uzaylarında kesin çözüm hesaplar. Büyük veya sürekli durum uzaylarında ise Q-learning, SARSA ve derin pekiştirmeli öğrenme (Deep RL) algoritmaları yaklaşık çözümler bulur; bu algoritmalar durum değer fonksiyonlarını sinir ağlarıyla yaklaştırarak milyonlarca durum-eylem çiftini yönetilebilir hale getirir. MDP'nin gerçek dünya uygulamaları son derece geniştir: satranç ve Go gibi oyunlarda (AlphaGo, AlphaZero), robot lokomotif kontrolünde, otonom araç yol planlamasında, ilaç dozlama optimizasyonunda ve öneri sistemlerinde temel çerçeve olarak işlev görür. Kısmi gözlemlenebilir ortamlarda ise POMDP (Partially Observable MDP) uzantısı kullanılır; ajan çevrenin tam durumunu değil yalnızca gürültülü gözlemleri bilir ve bunun üzerine inanç durumları (belief states) oluşturarak karar alır. Hem deterministik hem stokastik ortamlar için güçlü bir matematiksel temel oluşturan MDP, modern yapay zeka araştırmalarının vazgeçilmez çerçevesi olmayı sürdürmektedir.

arrow_forward
manage_search

Mechanistic Interpretability (Mekanistik Yorumlanabilirlik)

Mekanistik Yorumlanabilirlik (Mechanistic Interpretability), yapay sinir ağlarının iç hesaplama mekanizmalarını tersine mühendislik yöntemleriyle anlama ve açıklama çabasıdır. Bu disiplin, büyük dil modelleri ve derin öğrenme sistemlerinin "kara kutu" olarak adlandırılan opak yapısını çözerek hangi nöronların hangi kavramları kodladığını, hangi devrelerin (circuit) belirli hesaplamaları yürüttüğünü ve bu bileşenlerin birbirleriyle nasıl etkileşime girdiğini açıklamayı hedefler. Alan üç soyutlama katmanı üzerinde yoğunlaşır: Nöron düzeyinde tek bir aktivasyon biriminin hangi özellikleri (feature) temsil ettiği incelenir; devre düzeyinde nöronlar ve dikkat kafaları arasındaki örüntüler haritalanır; algoritma düzeyinde ise modelin gerçekleştirdiği üst düzey hesaplamaların soyut açıklaması yapılır. Bu hiyerarşi, "modelde ne oluyor?" sorusunu aşamalı olarak yanıtlamayı mümkün kılar. Başlıca araçlardan biri Seyrek Otokodlayıcılardır (Sparse Autoencoder — SAE). SAE'ler, modelin iç aktivasyonlarını yorumlanabilir, monosemantik (tek anlamlı) özelliklere ayrıştırarak polisemantikliği (bir nöronun birden fazla kavramı kodlaması) azaltır. Anthropic'in geliştirdiği devre izleme (circuit tracing) tekniği, Claude 3.5 Haiku üzerinde çok adımlı akıl yürütme, halüsinasyon ve reddedişler (refusal) konusunda nedensel haritalar üretmiştir. Google DeepMind ise benzer teknikleri dil ve görüntü modellerine uygulamıştır. 2026 yılında MIT Breakthrough Technology listesine giren mekanistik yorumlanabilirlik; AI güvenliği, model denetimi, halüsinasyon tespiti ve kötüye kullanım önleme açısından kritik bir altyapı haline gelmiştir. Anthropic, Google DeepMind ve EleutherAI bu alanda öncü araştırma gruplarıdır. Alan 2021'de yalnızca bir avuç araştırmacıya sahipken 2026'da yüzlerce aktif katkıcıya ulaşmıştır. Araştırmacıların kullandığı temel deneysel yöntemlerden biri aktivasyon yamalamadır (activation patching): bir modelin belirli bir bileşeni kontrollü biçimde değiştirilerek bu bileşenin nihai çıktıya katkısı ölçülür. Bu yöntem, hangi devrenin hangi göreve nedensel olarak bağlı olduğunu doğrulamak için kritiktir. Lineer temsil sondalaması (linear probing) ise model katmanları arasındaki bilginin hangi noktada kodlandığını saptamak için kullanılır. Bu araçlar, mekanistik yorumlanabilirliği salt gözlemsel değil, nedensellik odaklı bir disiplin haline getirir.

arrow_forward
hub

Mixture of Agents (Ajanların Karışımı)

Mixture of Agents (MoA — Ajan Karışımı), birden fazla büyük dil modelinin aynı sorunu bağımsız olarak yanıtladığı, ardından özel bir "aggregator" modelin bu yanıtları bütünleştirerek tek ve rafine bir çıktı ürettiği yapay zeka mimarisidir. Together AI tarafından 2024 yılında önerilen bu yaklaşım, tekil model yerine model topluluğu kullanarak AlpacaEval 2.0 kıyaslamasında GPT-4 Turbo'yu geride bırakan sonuçlar elde etmiştir. MoA'nın temel döngüsü iki rol üzerine kuruludur. Birinci katmandaki "proposer" modeller — örneğin Llama, Qwen, Mistral veya Gemma — aynı kullanıcı sorgusunu birbirinden bağımsız biçimde yanıtlar. İkinci aşamadaki "aggregator" modeli ise bu yanıtların tamamını bağlamına alarak çelişkili noktaları ortadan kaldırır, ortak doğruları pekiştirir ve tutarlı bir nihai metin üretir. Bu iki katman ihtiyaca göre tekrarlanabilir; her çevrim bir önceki aggregation çıktısını yeniden iyileştiren ek bir filtre katmanı olarak işlev görür. MoA mimarisi, Mixture of Experts (MoE) kavramıyla sıklıkla karıştırılır. MoE, Mixtral-8x7B örneğinde olduğu gibi, tek bir modelin içindeki uzman alt-ağları token bazlı olarak dinamik biçimde aktive eder. MoA ise ayrı ve bağımsız çalışan birden fazla modeli dışarıdan birleştiren bir topluluk (ensemble) çerçevesidir; her model kendi ağırlıklarını ve bağlamını bağımsız olarak işler. Maliyet açısından değerlendirildiğinde, proposer katmanında küçük ve ekonomik açık kaynaklı modeller kullanılabilirken aggregator katmanında daha büyük bir model tercih edilebilir. Bu asimetrik yapı düşük işletim maliyetiyle yüksek çıktı kalitesini bir arada sunar. Bununla birlikte, her katman ek gecikme (latency) ve token maliyeti doğurduğundan katman sayısının uygulamanın gecikme toleransına göre dengelenmesi gerekir. Pratik kullanım alanları arasında karmaşık soru yanıtlama, kod üretimi, hukuki ve tıbbi metin analizi gibi yüksek doğruluk gerektiren görevler öne çıkar. Together AI'ın açık kaynak deposu "togethercomputer/moa-gpt-4o", birden fazla LLM'i sıralı katmanlar halinde birleştiren referans bir uygulama sunmaktadır. LangGraph ve LangChain gibi çerçeveler de MoA benzeri çok-ajan akışlar için hazır orkestrasyon altyapısı sunar.

arrow_forward
code_blocks

Mixture of Depths (Derinlik Karışımı)

Mixture of Depths (MoD, Türkçesiyle Derinlik Karışımı), transformer tabanlı dil modellerinde her tokenin her katmandan geçmesi kuralını gevşeten, hesaplama bütçesini token ve katman bazında dinamik olarak dağıtan bir adaptif hesaplama yöntemidir. Google DeepMind araştırmacıları (Raposo ve arkadaşları) tarafından 2024 yılında yayımlanan "Mixture-of-Depths: Dynamically allocating compute in transformer-based language models" makalesiyle tanıtıldı. Çıkış noktası basit bir gözlemdir: bir dizideki tokenlerin hepsi aynı derecede zor değildir; bazı tokenler için tam dikkat ve ileri besleme hesaplaması gereksizdir. Standart transformer bu farkı görmez ve her tokene aynı miktarda hesaplama harcar. MoD'de her transformer bloğunun başında hafif bir yönlendirici (router) bulunur. Yönlendirici her token için skaler bir ağırlık üretir; en yüksek ağırlığa sahip ilk k token bloğun tam işleminden (öz-dikkat ve MLP) geçer, kalan tokenler artık bağlantı (residual connection) üzerinden değişmeden bir sonraki bloğa aktarılır. Buradaki k değeri sabit bir kapasite olarak önceden belirlenir; makalede en iyi sonuçlar her iki blokta bir yönlendirme yapıp kapasiteyi dizinin %12,5'i ile sınırlamakla elde edilmiştir. Kapasitenin sabit olması önemli bir mühendislik avantajı getirir: tensör boyutları önceden bilindiği için hesaplama grafiği statik kalır ve donanım verimliliği erken çıkış (early exit) gibi dinamik yöntemlere göre çok daha iyidir. Yöntem, Mixture of Experts (MoE) ile sık karıştırılır ama farklı bir ekseni kontrol eder. MoE bir tokenin hangi uzman ağ tarafından işleneceğini seçerken, MoD tokenin bu blokta işlenip işlenmeyeceğini seçer. İki yaklaşım birbirine dik olduğundan aynı modelde birleştirilebilir; makale bu birleşimi MoDE (Mixture of Depths and Experts) adıyla sunar. Deneysel sonuçlara göre MoD modelleri, eşit eğitim FLOPs bütçesinde temel modellerden daha düşük kayıp değerine ulaşır; eşit kalitede ise ileri geçiş başına FLOPs belirgin biçimde azalır ve örnekleme sırasında adım süresi %50'ye kadar kısalır. MoD'nin en dikkat çekici zorluğu otoregresif üretimdir. Top-k seçimi dizideki tüm tokenleri görmeyi gerektirir, oysa üretim sırasında gelecekteki tokenler henüz yoktur. Makale bunun için iki çözüm önerir: yönlendirici çıktısına eklenen yardımcı bir ikili sınıflandırma kaybı ya da tokenin ilk k'ye girip girmeyeceğini tahmin eden küçük bir yardımcı MLP. Her iki yaklaşım da kalite kaybını ihmal edilebilir düzeyde tutar. MoD günümüzde araştırma aşamasında olup çok modlu büyük modeller için γ-MoD ve p-MoD gibi türevleri yayımlanmıştır.

arrow_forward
merge_type

Model Merging (Model Birleştirme)

Model Birleştirme (Model Merging), önceden eğitilmiş birden fazla yapay zeka modelinin ağırlıklarını ek bir eğitim sürecine gerek kalmaksızın matematiksel işlemler yoluyla tek bir modelde birleştirme tekniğidir. 2022-2025 yılları arasında özellikle açık kaynaklı büyük dil modelleri (LLM) topluluğunda hızla yaygınlaşan bu yöntem, pahalı yeniden eğitim maliyetlerini ortadan kaldırarak farklı yetenekleri tek bir model içinde bir araya getirmeyi mümkün kılar. Geleneksel transfer öğrenme yöntemlerinde her model ayrı ayrı eğitilirken, model birleştirme yalnızca modellerin ağırlık matrislerini (parametrelerini) matematiksel işlemler aracılığıyla birleştirir. Temel dayanak noktası, nöral ağların ağırlık uzayında lineer bağlantısal bölgeler oluşturduğuna dair gözlemdir. Bu sayede aynı temel mimariden türetilen modeller birbirleriyle uyumlu ağırlık uzayları paylaşır ve birleştirme mümkün hale gelir. Başlıca model birleştirme yöntemleri şunlardır: Ağırlık Ortalaması (Model Soup), modellerin basit aritmetik ortalamasını alır ve Wortsman vd. (2022) tarafından popularize edilmiştir. SLERP (Küresel Doğrusal Enterpolasyon), iki modeli düz bir çizgi yerine küresel yüzey üzerinden birleştirerek daha pürüzsüz geçişler sağlar. TIES-Merging, parametre çakışmalarını ve işaret tutarsızlıklarını gidererek çok modelli birleştirmelerde kayıpları minimize eder (Yadav vd., 2023). DARE (Drop and Rescale), rastgele parametre seyreltmesi uygulayarak çakışmaları azaltır. Görev Vektörleri (Task Vectors) ise ince ayarın ağırlık uzayında bıraktığı yöne işaret eden vektörlerdir; bu vektörler toplanarak ya da çıkarılarak yetenekler aktarılabilir. Model birleştirme pratikte mergekit (Goddard vd., 2024) gibi açık kaynaklı araçlarla uygulanmakta ve Hugging Face'te büyük bir topluluk tarafından benimsenmektedir. Bu yaklaşım, yeni yetenekler kazandırmak için binlerce GPU saati harcamak yerine dakikalar içinde denemeler yapmayı olanaklı kılar; hesaplama maliyetini ve karbon ayak izini önemli ölçüde düşürür. Temel kısıt, birleştirilen modellerin aynı mimari ve parametre sayısına sahip olmasıdır.

arrow_forward
compress

Model Sıkıştırma (Model Sıkıştırma)

Model sıkıştırma (model compression), derin öğrenme ve makine öğrenimi modellerinin boyutunu, hesaplama maliyetini ve bellek gereksinimlerini azaltmaya yönelik tekniklerin genel adıdır. Milyarlarca parametre içeren büyük yapay zeka modelleri; eğitim sürecinde muazzam donanım kaynakları tüketir ve üretim ortamında yüksek gecikme ile enerji maliyeti yaratır. Sıkıştırma teknikleri, bu ağır modelleri orijinal doğruluk değerlerine yakın tutarken çok daha küçük, hızlı ve verimli hale getirir. Temel model sıkıştırma yöntemleri dört ana başlık altında incelenir. Birincisi budama (pruning): modeldeki önemsiz ağırlıkları veya nöronları tespit edip kaldırarak bağlantılar seyreltilir; yapısal budama (structured pruning) bütün dikkat başlarını veya katmanları çıkarırken yapısal olmayan budama (unstructured pruning) bireysel bağlantıları kaldırır. Bu yöntemle %50-90 oranında parametre azaltımı elde edilebilir. İkincisi niceleme (quantization): 32-bit kayan noktalı ağırlık değerleri 8-bit, 4-bit hatta 2-bit tam sayılara dönüştürülür; bu dönüşüm bellek ayak izini 4-16 kat küçültür ve çıkarım (inference) hızını önemli ölçüde artırır. GPTQ, AWQ ve bitsandbytes bu alanda yaygın kullanılan araçlardır. Üçüncüsü bilgi damıtma (knowledge distillation): büyük bir öğretmen modelin yumuşak olasılık çıktıları küçük bir öğrenci modele aktarılarak kompakt ama güçlü modeller elde edilir; DistilBERT, TinyLLaMA ve Phi ailesi bu yaklaşımın başarılı örnekleridir. Dördüncüsü düşük ranklı ayrıştırma (low-rank factorization): büyük ağırlık matrisleri iki küçük matrisin çarpımına ayrıştırılır; LoRA ve QLoRA bu yaklaşımın modern ve son derece popüler uygulamalarıdır. Pratik ekosistemde GPTQ, AWQ, GGUF ve bitsandbytes gibi araçlar, büyük dil modellerini tüketici sınıfı GPU'larda ve hatta CPU üzerinde çalıştırılabilir hale getirmiştir. llama.cpp projesi, 70 milyar parametreli modellerin sıradan dizüstü bilgisayarlarda çalıştırılmasını mümkün kılmıştır. Model sıkıştırma; akıllı telefon tabanlı konuşma tanıma, gerçek zamanlı nesne algılama, uç cihaz (edge) yapay zekası, kaynak kısıtlı IoT sistemleri ve otonom araç yazılımları gibi kritik alanlarda belirleyici öneme sahiptir. Hesaplama demokrasisi açısından değerlendirildiğinde sıkıştırma teknikleri, güçlü yapay zeka modellerini yalnızca büyük şirketlerin değil bireysel geliştiricilerin ve küçük kuruluşların da kullanabildiği teknolojiler haline getiren en önemli etkenlerden biridir.

arrow_forward
account_tree

Monte Carlo Tree Search (MCTS) (Monte Carlo Ağaç Araması)

Monte Carlo Tree Search (MCTS), olasılıksal simülasyonlar kullanarak geniş karar ağaçlarında en iyi hamleyi bulan buluşsal bir arama algoritmasıdır. Klasik minimax aramasından farklı olarak tüm dalları değerlendirmek yerine yüzlerce rastgele simülasyon (rollout) çalıştırır ve kaynakları en umut verici bölgelere yoğunlaştırır. Dört aşamalı bir döngü üzerine kuruludur: Seçim aşamasında mevcut ağaçta UCT (Upper Confidence bounds applied to Trees) formülüyle en iyi düğüm seçilir; Genişleme aşamasında seçilen düğüme yeni çocuk düğümler eklenir; Simülasyon (Rollout) aşamasında rasgele ya da ağırlıklı politika oymasıyla bir sonuca gidilir; Geri Yayılım aşamasında simülasyon sonucu ağaçtan köke kadar taşınarak istatistikler güncellenir. Verilen süre ya da iterasyon sayısı dolana dek bu döngü tekrar eder; en çok ziyaret edilen kök çocuğu nihai hamle olarak seçilir. Algoritma 2006 yılında Rémi Coulom tarafından bilgisayarlı Go için önerilmiş, Kocsis ve Szepesvári'nin UCT formülüyle güçlendirilmiştir. 2016'da DeepMind'ın AlphaGo programı MCTS'i derin sinir ağlarıyla birleştirerek dünya Go şampiyonu Lee Sedol'ü 4-1 yenerek tarihin en dikkat çekici yapay zeka başarılarından birini gerçekleştirmiştir. 2017'de AlphaZero, satranç, shogi ve Go'da yalnızca öz-oyun ve MCTS kullanarak insan yazılmış bilgiye ihtiyaç duymaksızın tablo kıran performanslar elde etmiştir. UCT formülünün özü, keşif-sömürü dengesini matematiksel olarak çözmektir. Q_i/N_i terimi mevcut en iyi dalı sömürürken √(ln N / N_i) terimi az ziyaret edilmiş düğümleri keşfetmeyi özendirmektedir; c sabiti bu ikisi arasındaki ağırlığı belirler. MCTS, değerlendirme fonksiyonu tasarlamak güç olmakla birlikte simülasyonların hızlı olduğu board oyunlarından robot planlamasına, ilaç keşfine ve operasyon araştırmasına kadar pek çok alanda tercih edilen güçlü bir karar verme aracıdır. Ayrıca büyük dil modellerinin çıkarım süreçlerinde düşünce ağaçlarını genişletmek için de uyarlanmaktadır.

arrow_forward
architecture

Neural Architecture Search (NAS) (Nöral Ağ Mimarisi Arama)

Neural Architecture Search (NAS), bir makine öğrenimi görevi için en uygun sinir ağı mimarisini insan müdahalesi olmadan otomatik olarak keşfeden ve AutoML alanının temel dallarından birini oluşturan yapay zeka tekniğidir. Geleneksel derin öğrenme iş akışında araştırmacılar katman sayısı, bağlantı desenleri, aktivasyon fonksiyonları ve boyut seçimleri gibi onlarca tasarım kararını elle yapılandırır; bu süreç uzman bilgisi gerektirir ve haftalarca sürebilir. NAS bu manuel döngüyü sistematik bir optimizasyon problemine dönüştürerek hem süreyi hem gerekli uzmanlığı azaltır. NAS üç temel bileşenden oluşur: arama uzayı (olası mimarilerin yapısal şablonu), arama stratejisi (hangi adayların değerlendirileceğini belirleyen algoritma) ve performans tahmini (mimarileri derecelendiren ölçüm yöntemi). Pekiştirmeli öğrenme tabanlı RL-NAS, evrimsel algoritmalar, gradyan tabanlı DARTS (Differentiable Architecture Search) ve ağırlık paylaşımlı One-Shot NAS bu bileşenlerin farklı kombinasyonlarını kullanır. Google Brain'in 2017'deki ilk RL-NAS çalışması 800 GPU'da 28 gün gerektirirken, 2018'de tanıtılan DARTS bu maliyeti tek bir GPU-gününe indirdi. Weight Sharing yöntemleri ek 100× hızlanma sağladı. EfficientNet ve NASNet, ImageNet sıralamasında manuel tasarlanan modelleri geride bırakarak endüstri standardı haline geldi; EfficientNet B7 sürümü %84,4 Top-1 doğruluğu ile kıyaslama testlerini yeniden tanımladı. Günümüzde donanım farkındalıklı NAS, mobil cihaz gecikmesini ve bellek kısıtlarını arama hedefine katarak kenar cihazlara özel mimariler üretir. Apple Neural Engine ve Qualcomm Snapdragon için optimize edilmiş modeller bu teknikle tasarlanmaktadır. NAS-LLM çalışmaları ise transformatör başlık sayısı, FFN genişliği ve dikkat mekanizması yapısı gibi hiper-mimari kararları otomatikleştirmeye yönelmektedir. NAS'ın pratik sınırları arasında klasik yöntemlerin yüksek hesaplama maliyeti, bulunan mimarinin eğitim verisi ve donanıma özgü olması ile küçük veri kümelerinde genelleme güçlüğü yer alır. Uygulamada Google Vertex AI AutoML ve Azure Automated ML NAS işlevselliği sunarken, açık kaynak timm kütüphanesi daha esnek bir başlangıç noktası oluşturur.

arrow_forward
code_blocks

Noise Contrastive Estimation (Gürültü Karşıtlıklı Kestirim)

Noise Contrastive Estimation (NCE), Türkçesiyle gürültü karşıtlıklı kestirim, normalizasyon sabitinin hesaplanması pratik olmayan olasılık modellerinin parametrelerini öğrenmek için geliştirilmiş istatistiksel bir kestirim ilkesidir. Michael Gutmann ve Aapo Hyvärinen tarafından 2010 yılında AISTATS konferansında önerilen yöntem, zor bir yoğunluk kestirimi problemini basit bir ikili sınıflandırma görevine çevirir: model, gerçek veri dağılımından gelen örneklerle bilinen bir gürültü dağılımından çekilen yapay örnekleri birbirinden ayırt etmeyi öğrenir. Bu ayrımı iyi yapan bir model, dolaylı olarak gerçek veri dağılımının şeklini de öğrenmiş olur. Yöntemin çözdüğü temel sorun, normalize edilmemiş modellerde ortaya çıkan bölüşüm fonksiyonu (partition function) hesabıdır. Maksimum olabilirlik kestirimi, her parametre güncellemesinde tüm olası çıktılar üzerinden toplam almayı gerektirir. Kelime dağarcığı yüz binlerce token içeren bir dil modelinde softmax katmanının her adımda tüm dağarcık üzerinden hesaplanması, eğitim süresinin büyük bölümünü tek başına tüketir. NCE bu toplamı hiç hesaplamaz; normalizasyon sabitini ya öğrenilebilir bir parametre olarak modele ekler ya da Mnih ve Teh'in 2012'de gösterdiği gibi pratikte 1'e sabitler. Her gerçek örnek için k adet gürültü örneği çekildiğinden, adım başına maliyet dağarcık boyutundan bağımsız hale gelir ve yalnızca k ile orantılı kalır. NCE'nin teorik cazibesi tutarlılığından gelir: gürültü örneği sayısı k arttıkça kestirici maksimum olabilirlik çözümüne yaklaşır. Bu özellik, yöntemi enerji tabanlı modellerin ve yoğunluk kestiriminin eğitimi için de çekici kılar. Uygulama tarafında ise NCE, 2013'te Mikolov ve ekibinin Word2Vec için tasarladığı Negative Sampling yaklaşımının doğrudan öncülüdür. Negative Sampling, NCE'deki gürültü dağılımı terimini atarak daha basit bir amaç fonksiyonu kullanır; olasılık kestirimi için tutarlı olmasa da kaliteli kelime gömmeleri üretir. 2018'de van den Oord ve arkadaşlarının Contrastive Predictive Coding çalışmasıyla tanıttığı InfoNCE kaybı, aynı ilkeyi temsil öğrenimine taşıdı. Pozitif çifti k negatif arasından seçmeye dayanan bu kayıp, SimCLR, MoCo ve CLIP gibi öz-denetimli modellerin ve modern gömme modellerinin eğitiminde standart hale geldi. Günümüz büyük dil modelleri çıkış katmanında tam softmax kullansa da NCE ailesi, geri getirim, öneri sistemleri ve çok modlu öğrenme alanlarında yaygın biçimde kullanılmaya devam ediyor.

arrow_forward
code_blocks

Parçacık Sürü Optimizasyonu (PSO)

Parçacık sürü optimizasyonu (İng. Particle Swarm Optimization, PSO), James Kennedy ve Russell Eberhart tarafından 1995 yılında IEEE Uluslararası Sinir Ağları Konferansı'nda önerilen, sürü zekasına dayalı bir meta-sezgisel optimizasyon algoritmasıdır. Algoritmanın temel esin kaynağı, merkezi bir yönlendirme olmaksızın koordineli davranan kuş sürüleri ve balık okullarının kolektif davranışıdır. PSO, bir "sürü" oluşturan aday çözümler kümesiyle çalışır; her aday çözüme "parçacık" adı verilir. Her parçacık, arama uzayında bir konum (X) ve bir hız vektörüyle (V) temsil edilir. Optimizasyon sürecinde her parçacık iki bilgiden yararlanır: kendi geçmişte ulaştığı en iyi konum (kişisel en iyi, pBest) ve sürünün tümünün şimdiye kadar bulduğu en iyi konum (küresel en iyi, gBest). Hız güncelleme formülü şu şekildedir: V(t) = w·V(t-1) + c₁·r₁·(pBest - X) + c₂·r₂·(gBest - X). Burada w atalet ağırlığı, c₁ bilişsel katsayı, c₂ sosyal katsayı; r₁ ve r₂ ise [0,1] aralığındaki rastgele sayılardır. Shi ve Eberhart (1998), w değerini yinelemeler boyunca 0,9'dan 0,4'e doğrusal olarak azaltmanın küresel keşif ile yerel sömürü arasındaki dengeyi iyileştirdiğini göstermiştir. Makine öğrenmesinde PSO; yapay sinir ağlarında hiper-parametre optimizasyonu (katman sayısı, öğrenme hızı, batch boyutu), sinir mimarisi araması (NAS) ve özellik seçimi için yaygın biçimde kullanılır. Araştırmalar, 20-50 parçacıktan oluşan küçük bir sürünün bile etkili sonuçlar ürettiğini göstermektedir. Başlıca varyantları arasında Uyarlanabilir PSO (APSO, Zhan vd. 2009), zaman değişkenli ivme katsayılı PSO (PSO-TVAC) ve kombinatoryal problemler için Ayrık PSO sayılabilir. Genetik algoritmalarla karşılaştırıldığında PSO, çaprazlama ve mutasyon operatörlerine gerek duymadan daha az parametreyle çalışır; bu durum özellikle sürekli değerli optimizasyon problemlerinde daha hızlı yakınsama sağlar. Başlıca sınırlılığı erken yakınsamadır: parçacıklar küresel en iyiye hızla yöneldiğinde sürü çeşitliliği azalır ve algoritma yerel bir optimumda takılı kalabilir.

arrow_forward
center_focus_strong

PCA (Principal Component Analysis) (Temel Bileşen Analizi)

Temel Bileşen Analizi (Principal Component Analysis — PCA), yüksek boyutlu veri kümelerindeki boyut sayısını azaltırken verideki varyansı (bilgiyi) mümkün olduğunca korumayı hedefleyen doğrusal bir boyut indirgeme tekniğidir. 1901'de Karl Pearson tarafından önerilen bu yöntem, makine öğrenmesi, veri görselleştirme ve özellik mühendisliğinin temel araçlarından biri haline gelmiştir. PCA'nın matematiksel temeli kovaryans matrisinin özvektörlerine dayanır. Algoritma önce verinin ortalama merkezlemesini yapar, ardından kovaryans matrisini hesaplar ve bu matrisin özvektörlerini (temel bileşenleri) bulur. Her özvektöre karşılık gelen özdeğer, o bileşenin toplam varyansın ne kadarını açıkladığını ifade eder. Veriler, en yüksek özdeğerlere sahip k özvektörden oluşan yeni bir koordinat sistemine yansıtılır ve bu projeksiyon işlemiyle boyut sayısı dramatik biçimde azalır. Pratikte PCA birkaç kritik amaca hizmet eder: boyutsallık laneti sorununu hafifletmek, görselleştirme için yüksek boyutlu veriyi 2 veya 3 boyuta indirmek, gürültülü ve tekrarlayan özellikleri elemek, model eğitim süresini kısaltmak ve aşırı öğrenme riskini azaltmak. Örneğin 1000 özelliğe sahip bir tıbbi veri kümesinin ilk 50 temel bileşeni, toplam varyansın büyük çoğunluğunu açıklayabilir ve model performansını olumsuz etkilemeden hesaplama maliyetini önemli ölçüde düşürebilir. PCA'nın sınırlamaları arasında yalnızca doğrusal ilişkileri yakalayabilmesi öne çıkar; doğrusal olmayan yapılar için Kernel PCA, t-SNE veya UMAP gibi yöntemler tercih edilir. Ayrıca elde edilen temel bileşenler orijinal özelliklerle birebir yorumlanamaz; bu durum bazı alanlarda açıklanabilirlik sorunlarına yol açabilir. Veri ölçeklendirmesi (standardizasyon) PCA öncesinde zorunlu bir ön işleme adımıdır; aksi takdirde büyük ölçekli özellikler küçük ölçeklileri baskılayarak bileşenleri çarpıtır. Görüntü sıkıştırma, yüz tanıma (eigenfaces yöntemi), genomik analiz, doğal dil işlemede gizli anlam analizi (LSA) ve finans portföy analizi PCA'nın en yaygın uygulama alanları arasında yer almaktadır. Söz konusu çok yönlülük, PCA'yı veri bilimcilerinin araç kutusunun vazgeçilmez bir parçası yapmaktadır.

arrow_forward
code_blocks

Prefix-Tuning (Önek Ayarlama (Prefix-Tuning))

Prefix-Tuning (Önek Ayarlama), büyük dil modellerini yeni bir göreve uyarlarken modelin tüm ağırlıklarını dondurup yalnızca her transformer katmanının dikkat mekanizmasına eklenen kısa, öğrenilebilir vektör dizilerini (prefix) eğiten parametre verimli ince ayar (PEFT) yöntemidir. Yöntem, 2021 yılında Stanford Üniversitesi'nden Xiang Lisa Li ve Percy Liang tarafından "Prefix-Tuning: Optimizing Continuous Prompts for Generation" başlıklı makaleyle önerildi. Temel fikir, elle yazılan istemlerin (prompt) yerine gradyan inişiyle optimize edilen sürekli vektörler kullanmaktır; bu vektörler sözlükte karşılığı olmayan "sanal token"lar gibi davranır ve modelin dikkatini görev için doğru bağlama yönlendirir. Teknik olarak prefix, her katmandaki anahtar (key) ve değer (value) matrislerinin önüne eklenen sabit uzunlukta bir gizli durum dizisidir. Eğitim sırasında yalnızca bu diziler gradyan güncellemesi alır; GPT-2 veya BART gibi temel modelin milyonlarca ya da milyarlarca parametresi olduğu gibi kalır. Li ve Liang'ın deneylerinde toplam parametrelerin yaklaşık yüzde 0,1'i eğitilerek tablodan metne üretim ve özetleme görevlerinde tam ince ayara yakın sonuçlar elde edildi; az veri bulunan senaryolarda ve eğitimde görülmemiş konulara genelleme yaparken prefix-tuning tam ince ayarı geride bıraktı. Bu yaklaşımın en somut faydası çok görevli dağıtımda görülür. Tek bir temel model bellekte tutulur, her görev için yalnızca birkaç megabaytlık prefix dosyası saklanır ve istek geldiğinde ilgili prefix yüklenir. Böylece bir kurum aynı modeli özetleme, soru üretimi ve rapor yazımı gibi farklı işler için tam kopya oluşturmadan kullanabilir. Prefix-Tuning, yalnızca giriş katmanına vektör ekleyen Prompt Tuning'den daha derin bir müdahale sunar; ağırlık matrislerine düşük rankli güncelleme ekleyen LoRA'dan ise mekanizma olarak ayrılır. Günümüzde Hugging Face PEFT kütüphanesi bu yöntemi doğrudan destekler ve P-Tuning v2 gibi türevleri aynı fikri sınıflandırma görevlerine de taşımıştır.

arrow_forward
code_blocks

PRM (Süreç Ödül Modeli)

PRM (Process Reward Model — Süreç Ödül Modeli), bir dil modelinin akıl yürütme zincirindeki her adımı ayrı ayrı puanlayan ödül modelidir. Yalnızca nihai cevaba bakan ORM'nin (Outcome Reward Model) aksine PRM, çözüm boyunca her ara adıma bağımsız bir skor üretir; bu yapı matematiksel muhakeme, kod üretimi ve mantık problemleri gibi çok adımlı görevlerde modelin hatalı düşünce zincirlerini yakalamayı mümkün kılar. PRM'ler iki temel bağlamda devreye girer. Birincisi çıkarım anında doğrulayıcı (verifier) olarak: model aynı soruya N farklı çözüm üretir, PRM her zinciri puanlar ve en yüksek skorlu aday seçilir. Bu yaklaşım, 'Let's Verify Step by Step' makalesinde MATH kıyaslamasında çoğunluk oylamasını ve ORM'yi belirgin biçimde geride bıraktı. İkincisi RL eğitiminde yoğun ödül sinyali olarak: seyrek sonuç ödülünün yetersiz kaldığı uzun zincirlerde PRM her adıma geribildirim vererek politikayı daha hızlı iyileştirir. OpenAI'nin 2023'te yayımladığı PRM800K veri seti, alanın mihenk taşıdır: MATH problemlerindeki 800 binden fazla adım insan uzmanlar tarafından tek tek doğru/nötr/hatalı olarak etiketlendi. Math-Shepherd (2024) bu maliyetli insan emeğine alternatif sunar; bir adımdan devam eden tamamlamaların doğru sonuca ulaşma oranını Monte Carlo örneklemesiyle tahmin ederek otomatik etiket üretir. Qwen2.5-Math-PRM-72B gibi açık ağırlıklı modeller, üretim ortamında Best-of-N kurulumlarında matematik skorunu 8-10 puan artırabilmektedir. DeepSeek-R1 teknik raporu, büyük ölçekli RL eğitiminde PRM kullanmama kararını üç gerekçeyle açıkladı: genel muhakemede 'iyi adım' tanımı belirsiz, otomatik etiketleme güvenilmez ve model tabanlı ödül ödül hacklemeye kapı açıyor. R1 bunun yerine doğrulanabilir görevlerde kural tabanlı sonuç ödülüyle GRPO eğitimini benimsedi. 2026 itibarıyla yerleşik reçete şu ikili üzerine kurulu: eğitim sinyali için doğrulanabilir sonuç ödülü, çıkarım ve veri kalitesi katmanı için PRM. ProcessBench ve PRMBench gibi yeni kıyaslama setleri PRM'lerin hata tespit becerisini ince taneli hata türleriyle ölçerek araştırmanın önünü açmaktadır.

arrow_forward
code_blocks

Q-Learning (Q-Öğrenme)

Q-Learning, pekiştirmeli öğrenmenin (reinforcement learning) model-bağımsız ve off-policy bir alt dalıdır. 1989 yılında Christopher Watkins tarafından geliştirilen bu algoritma, bir ajanın çevresiyle deneme-yanılma yoluyla etkileşime girerek en yüksek birikimli ödülü sağlayacak politikayı öğrenmesini hedefler. Algoritmanın temel bileşeni Q-değer fonksiyonu Q(s, a)'dır. Burada s bir durumu (state), a ise bir eylemi (action) temsil eder. Q(s, a), ajan s durumundayken a eylemini seçip ardından optimal stratejiyi izlediğinde elde edeceği beklenen toplam gelecek ödülü ifade eder. Q harfi kalite kelimesinden gelir ve belirli bir durumda belirli bir eylemin ne kadar değerli olduğunu ölçer. Öğrenme süreci bir Q-tablosu üzerinden yürür. Başlangıçta sıfırlarla başlatılan bu tablo, ajan her eylemden sonra alınan r ödülü ve gözlemlenen yeni s' durumuna göre Bellman denklemiyle güncellenir: Q(s, a) ← Q(s, a) + α · [r + γ · max_a' Q(s', a') − Q(s, a)]. Bu formülde α öğrenme oranını, γ indirim faktörünü gösterir; indirim faktörü yakın ödüllerin mi yoksa uzak ödüllerin mi öne çıkarılacağını belirler. Ajan, yeni durumları keşfetmek (exploration) ile bilinen en iyi eylemi seçmek (exploitation) arasındaki dengeyi ε-greedy stratejisiyle yönetir. Durum uzayı büyüdükçe Q-tablosu pratik olmaktan çıkar. Bu sorunu aşmak için DeepMind 2015'te Derin Q-Ağı'nı (Deep Q-Network, DQN) tanıttı. DQN, Q-tablosunu derin bir sinir ağıyla değiştirir ve deneyim tekrarı (experience replay) ile hedef ağ (target network) gibi mekanizmalar aracılığıyla öğrenmeyi kararlı kılar. DQN, yalnızca ham piksel verisiyle 49 Atari oyununda insan düzeyinde performans göstererek derin pekiştirmeli öğrenme alanını doğurdu. Q-Learning bugün enerji sistemleri optimizasyonu, otonom araç kontrolü, robotik görev planlama, kenar-bulut bilişimde gecikme yönetimi ve ilaç keşfinde aktif biçimde kullanılmaktadır.

arrow_forward
code_blocks

Quantum Machine Learning (Kuantum Makine Öğrenimi)

Quantum Machine Learning (QML — Kuantum Makine Öğrenimi), kuantum hesaplama ilkeleriyle klasik makine öğrenmesi algoritmalarını birleştiren disiplinlerarası bir araştırma alanıdır. QML, kuantum bilgisayarların süperpozisyon, dolanıklık (entanglement) ve girişim (interference) özelliklerinden yararlanarak belirli öğrenme ve optimizasyon görevlerini klasik bilgisayarlara kıyasla daha hızlı ya da daha verimli biçimde gerçekleştirmeyi hedefler. Kuantum bitleri (kübit), süperpozisyon ile aynı anda 0 ve 1 durumlarının doğrusal birleşiminde bulunabilir; bu özellik, belirli hesaplamaların paralel yürütülmesini olanaklı kılar. İki kübit arasındaki kuantum dolanıklığı ise aralarında klasik iletişim gerekmeksizin güçlü korelasyonlar oluşturur. Teorik analizler, doğrusal denklem sistemlerinde üstel hızlanma (HHL algoritması) ve yapılandırılmamış aramada karesel hızlanma (Grover algoritması) öngörmektedir. Temel QML yaklaşımları arasında Kuantum Destek Vektör Makineleri (QSVM), Değişimsel Kuantum Devreler (VQC), Kuantum Sinir Ağları (QNN) ve Kuantum Yaklaşık Optimizasyon Algoritması (QAOA) öne çıkmaktadır. VQC'ler parametrik kuantum kapılarıyla oluşturulmuş ve klasik optimizörlerle eğitilen hibrit devrelerdir; NISQ (Noisy Intermediate-Scale Quantum) çağının en gerçekçi yaklaşımı olarak kabul görmektedir. Değişimsel Kuantum Özdeğer Çözücüsü (VQE) ise kimya simülasyonu ve ilaç keşfinde moleküler enerji hesaplamak için kullanılmaktadır. NISQ çağında mevcut kuantum işlemciler yüzlerce fiziksel kübit içermekte; ancak gürültü ve hata oranları yüksek kalmaktadır. Genel amaçlı makine öğrenmesi görevlerinde kanıtlanmış bir kuantum hızlanması henüz pratik ölçekte gösterilememiştir. PennyLane, Qiskit Machine Learning ve TensorFlow Quantum gibi açık kütüphaneler, klasik ML araçlarıyla entegre hibrit iş akışları geliştirmeyi kolaylaştırmakta ve araştırmacıların gerçek kuantum donanımlarında deney yapmasını erişilebilir kılmaktadır. Bu araç ekosistemi, QML'nin teorik potansiyelini pratik uygulamaya taşımanın önündeki en kritik köprü işlevi görmektedir. Kuantum hesaplama, ilaç molekülü tasarımını, kriptografiyi ve finans portföy optimizasyonunu dönüştürme potansiyeli taşımakta; QML bu potansiyelin makine öğrenmesi boyutunu oluşturmaktadır.

arrow_forward
forest

Random Forest (Rastgele Orman)

Rastgele Orman (Random Forest), tek bir karar ağacının aşırı uyum (overfitting) zayıflığını aşmak için yüzlerce veya binlerce bağımsız karar ağacının bir arada çalıştırıldığı topluluk öğrenimi (ensemble learning) yöntemidir. Her ağaç, verinin rastgele seçilmiş bir alt kümesi üzerinde eğitilir; tahmin aşamasında tüm ağaçların çıktısı oylamaya (sınıflandırma) ya da ortalalamaya (regresyon) tabi tutularak nihai sonuç elde edilir. Yöntemin temel ilkesi "bagging" (Bootstrap Aggregating) olarak adlandırılır: eğitim verisi yerine her ağaç için rastgele örneklem çekilerek ağaçlar arasındaki korelasyon azaltılır. Ayrıca her dal bölünme noktasında yalnızca rastgele seçilmiş bir özellik alt kümesi değerlendirilir; böylece ağaçların birbirinden bağımsız kalması güvence altına alınır. Rastgele Orman'ın avantajları şunlardır: yüksek boyutlu verilerde iyi performans gösterir; eksik değerlere ve gürültüye karşı dirençlidir; özellik önem skorları (feature importance) üretir; hiperparametre ayarı görece basittir. Sınıflandırma ve regresyon görevlerinin yanı sıra anomali tespiti ve boyut azaltma uygulamalarında da kullanılır. Dezavantajları arasında büyük ağaç sayılarında yavaş tahmin süresi ve yorumlanabilirlik güçlüğü sayılabilir: binlerce ağaçtan oluşan bir ormanın "neden bu kararı verdiği" tek bir karar ağacına göre açıklamak daha zordur. Bu nedenle yorum gerektiren finans ve sağlık uygulamalarında SHAP değerleri gibi açıklanabilirlik araçlarıyla birlikte kullanılır. scikit-learn kütüphanesinde `RandomForestClassifier` ve `RandomForestRegressor` sınıfları ile kolayca uygulanır. `n_estimators` (ağaç sayısı), `max_depth` (maksimum derinlik) ve `max_features` (dal başına değerlendirilen özellik sayısı) en kritik hiperparametrelerdir. Büyük veri setlerinde XGBoost veya LightGBM gibi gradient boosting alternatifleri tercih edilse de Rastgele Orman, hızlı prototipleme ve temel performans ölçütü oluşturma açısından hâlâ standart başlangıç modeli olarak kabul görmektedir. Uygulama alanları açısından Rastgele Orman; kredi riski puanlaması, hastalık teşhisi, müşteri kaybı tahmini (churn prediction), nesne tanıma ve metin sınıflandırması gibi geniş bir yelpazede başarıyla kullanılmıştır. Türkiye'deki veri bilimi projelerinde ise bankacılık ve e-ticaret sektörlerinde sık başvurulan bir yöntem olduğu gözlemlenmektedir. Açıklanabilir yapay zeka (XAI) bağlamında SHAP kütüphanesi, Rastgele Orman modellerinin bireysel tahminlerini yorumlamak için doğrudan entegre edilebilir.

arrow_forward
sync_alt

ReAct (Akıl Yürütme + Eylem)

ReAct (Reasoning + Acting), büyük dil modellerinin (LLM) akıl yürütme izlerini (reasoning traces) ve eylemleri (actions) birbirine kenetleyerek ürettiği bir prompting çerçevesidir. Shunyu Yao ve arkadaşları tarafından 2022 yılında yayımlanan "ReAct: Synergizing Reasoning and Acting in Language Models" makalesiyle tanıtılmıştır. Geleneksel zincir-düşünce (Chain-of-Thought) prompting'i yalnızca dahili akıl yürütmeye dayanırken, ReAct modelin aynı zamanda harici araçlarla (web arama, hesap makinesi, veritabanı sorgusu) etkileşime girmesine olanak tanır. Her adımda model önce bir düşünce üretir (Thought), ardından bir eylem gerçekleştirir (Action), sonra bu eylemin sonucunu gözlemler (Observation) ve döngü tekrarlanır. ReAct döngüsü şu şekilde işler: 1) Model mevcut bağlamı değerlendirerek sıradaki adım için bir plan düşüncesi (Thought) üretir. 2) Bir araç çağrısı veya başka bir eylem (Action) tanımlar. 3) Araçtan dönen sonucu gözlemler (Observation). 4) Gözlemi bağlama ekleyerek yeni bir Thought üretir. Bu döngü görev tamamlanana kadar devam eder. ReAct, AI ajan çerçevelerinin (LangChain, LlamaIndex, OpenAI Agents, Google Vertex AI Agents) temel akıl yürütme stratejisi olarak yaygınlaşmıştır. Özellikle açık uçlu soru cevaplama, olgusal doğrulama (fact-checking) ve çok adımlı problem çözmede saf CoT'a kıyasla belirgin doğruluk artışı sağlar. Modelin hem düşüncesini hem de eylemini izlenebilir kılması, hata ayıklamayı ve güvenilirliği artırır. Pratik uygulamada ReAct bazı zorluklarla karşılaşılır: uzun döngülerde bağlam penceresinin taşması, tekrarlanan araç çağrılarıyla oluşan eylem döngüleri (action loops) ve hatalı araç parametrelerinden kaynaklanan kırılmalar bunların başında gelir. Bu sorunlara yanıt olarak Reflexion, Plan-and-Execute ve Tree of Thoughts gibi çerçeveler geliştirilmiştir. OpenAI'nin function calling ve Anthropic'in tool use API'leri ReAct mantığını yapılandırılmış JSON araç çağrısına dönüştürerek kararlılığı önemli ölçüde artırmaktadır. 2024-2026 itibarıyla çoğu üretim ortamı ajan sistemi, ReAct'in temel Thought-Action-Observation soyutlamasını alt katman olarak korurken üzerine hafıza, paralel görev yürütme ve hata kurtarma mekanizmaları eklemektedir.

arrow_forward
code_blocks

Self-Consistency (Öz-Tutarlılık)

Self-Consistency (Öz-Tutarlılık), büyük dil modellerinin akıl yürütme görevlerindeki doğruluğunu artırmak için Xuezhi Wang ve arkadaşlarının 2022'de arXiv'de yayımladığı ve ICLR 2023'te sunduğu bir çözümleme (decoding) stratejisidir. Yöntemin özü şudur: model, aynı soruya birbirinden bağımsız birden fazla çözüm yolu üretir; ardından en sık tekrar eden nihai yanıt çoğunluk oylamasıyla (majority voting) seçilir. Geleneksel greedy decoding stratejisinde model her adımda en yüksek olasılıklı tokeni seçer. Bu yaklaşım hızlı olsa da tek bir hatalı adım tüm çözüm zincirini bozabilir. Self-Consistency ise sıcaklık (temperature) parametresini yükselterek modelin stokastik örneklemesini etkinleştirir ve farklı düşünce yolları (reasoning paths) üretmesine olanak tanır. 10 ile 40 arasında örnek üretilip çoğunluk oylaması uygulandığında, aritmetik akıl yürütme ve sağduyu (commonsense) görevlerinde greedy Chain-of-Thought'a kıyasla 4 ile 18 puan arasında iyileşme bildirilmiştir; GSM8K'da PaLM-540B ile bu fark yaklaşık 18 puandır. Yöntemin temel sezgisi şudur: doğru çözüme birden fazla farklı yoldan ulaşılabilir, hatalı çözümler ise genellikle birbirinden farklı, dağınık yanıtlara savrulur. Bu asimetri, çoğunluk oylamasını güçlü bir filtre hâline getirir. Chain-of-Thought (CoT) prompting ile birleştirildiğinde etkinliği daha da artar, çünkü her reasoning path adım adım gerekçelendirilmiş olur ve yalnızca nihai yanıt oylanır; ara adımların birbirinden farklı olması sorun oluşturmaz. Uygulama tarafında Self-Consistency ek bir model, doğrulayıcı (verifier) ya da yeniden eğitim gerektirmez; yalnızca örnekleme parametreleri ve basit bir sayım mantığı yeterlidir. Bu yüzden hem kapalı API'lerle hem de açık ağırlıklı modellerle kullanılabilir. Yanıtların birbirine ne kadar yakın olduğu ayrıca bir güven (kalibrasyon) sinyali olarak okunabilir: oylar dağınıksa modelin o soruda kararsız olduğu anlaşılır. Pratik kısıtlar açısından değerlendirildiğinde, her sorgu için 10 ile 40 kat daha fazla API çağrısı ve token tüketimi söz konusudur. Dolayısıyla Self-Consistency, gecikmeye duyarlı üretim sistemlerinden çok yüksek doğruluk gerektiren toplu (batch) görevler, değerlendirme setleri ve veri etiketleme akışları için uygundur. Günümüzde aynı ilke, OpenAI o1/o3 ve DeepSeek-R1 gibi düşünen modellerin test-time compute stratejilerinde ve Best-of-N örnekleme yaklaşımlarında yerleşik hâle gelmiştir.

arrow_forward
code_blocks

Spectral Clustering (Spektral Kümeleme)

Spektral kümeleme, geleneksel mesafe tabanlı yöntemlerin yetersiz kaldığı karmaşık ve iç içe geçmiş veri yapılarını tespit edebilen, grafik teorisi ile lineer cebiri birleştiren bir kümeleme algoritmasıdır. Temel fikri, veri noktaları arasındaki benzerlik ilişkilerini bir grafik olarak modellemek ve bu grafiğin Laplacian matrisinin özvektörlerini düşük boyutlu kümeleme için kullanmaktır. Algoritmanın kökeni, 1970'lerin grafik kesim (graph partitioning) problemlerine dayanır; ancak makine öğrenmesine yönelik modern biçimlenmesi Shi ve Malik'in 2000 tarihli "Normalized Cuts and Image Segmentation" çalışmasıyla ivme kazandı. Ng, Jordan ve Weiss ise 2002'de yöntemi yaygın kullanılan standart hale getirdi. Spektral kümeleme üç temel aşamada çalışır. İlk aşamada her veri noktasını bir düğüm, iki nokta arasındaki benzerliği ise (Gauss/RBF çekirdeği ya da k-NN yöntemiyle hesaplanmış) bir kenar ağırlığı olarak tanımlayan W benzerlik matrisi oluşturulur. İkinci aşamada grafik Laplacian'ı (L = D − W veya normalize biçimi) hesaplanır ve ilk k özvektörü çıkarılır; bu özvektörler orijinal verinin küme yapısını koruyarak düşük boyutlu uzayda temsil eder. Üçüncü aşamada bu özvektör uzayındaki noktalar K-Means ile kümelenir. Bu son adım, doğrusal olmayan sınırlara sahip kümelerin bile ayrılabilir hale gelmesini sağlar. Algoritmanın en önemli avantajı şekil bağımsızlığıdır: ay biçimli (crescent), halka (ring) veya iç içe geçmiş spiral veri kümeleri gibi K-Means'in başarısız olduğu durumlarda üstün performans gösterir. Görüntü bölütleme, sosyal ağ topluluk tespiti, biyoinformatik gen ifadesi analizi ve belge kümeleme başlıca uygulama alanları arasındadır. scikit-learn kütüphanesindeki SpectralClustering sınıfı Python ekosisteminde standart uygulamayı sunar. Temel sınırlılık ölçeklenebilirlik sorunudur: Laplacian özdeğer ayrışımının O(n³) zaman karmaşıklığı büyük veri kümelerinde hesaplama yükünü artırır. Bu sorunu gidermek için Nyström yaklaşımı ve Landmark-based Spectral Clustering gibi yaklaşık yöntemler geliştirilmiştir. Küme sayısı k'nın önceden belirlenmesi zorunludur; eigengap heuristiği ile özvektörler arasındaki en büyük boşluğa bakarak k tahmini yapılabilir. Modern derin öğrenme alanında spektral yöntemler grafik sinir ağlarının (GNN) teorik temelini oluşturmaktadır: GCN (Graph Convolutional Network), ChebNet ve Graph Attention Network mimarileri doğrudan spektral grafik teorisinden türemektedir.

arrow_forward
memory

State Space Model (Durum Uzayı Modeli)

State Space Model (SSM), kontrol teorisinin köklü matematiksel altyapısından ilham alarak derin öğrenme mimarisine adapte edilmiş, dizi verilerini işlemek için kullanılan güçlü bir yaklaşımdır. Temel fikir zariftir: bir gizli durum vektörü (h), her yeni girdi tokeni işlendiğinde güncellenir ve tüm geçmiş bilgiyi sıkıştırılmış biçimde taşır. Böylece sistem her adımda yalnızca mevcut girdi ile gizli duruma bakar; bu da bellek ve hesaplama açısından büyük bir verimlilik sağlar. Matematiksel olarak klasik bir SSM üç temel denklemle tanımlanır: durum geçiş denklemi h'(t) = Ah(t) + Bx(t), çıkış denklemi y(t) = Ch(t) + Dx(t) ve bu parametreler (A, B, C, D matrisleri) eğitim sürecinde öğrenilir. Sürekli zamandaki bu denklemler, sinir ağlarına entegre edilmek üzere ayrık zamana dönüştürülür; bu adıma "diskritizasyon" denir. SSM'lerin derin öğrenmede yeniden popülerleşmesi 2021 yılında Albert Gu ve ekibinin S4 (Structured State Spaces for Sequences) modeliyle başladı. S4, uzun bağımlılıkları yakalamak için HiPPO matris teorisini kullanarak dikkat mekanizmasına ihtiyaç duymadan çok uzun dizileri işleyebildiğini kanıtladı. Ardından Gu ve Tri Dao'nun 2023'teki Mamba çalışması "seçici durum uzayı" mekanizmasını tanıttı: parametreler artık girdiye bağlı hale geldi; model her token için SSM parametrelerini dinamik olarak uyarladı. Transformer modellerine kıyasla SSM'lerin en kritik avantajı hesaplama karmaşıklığındadır. Transformer'lar dikkat mekanizması nedeniyle O(n²) karmaşıklığa sahipken SSM'ler O(n) doğrusal karmaşıklıkla çalışır; bu da özellikle çok uzun dizilerde belirgin bir hız ve bellek avantajı sağlar. Mamba, sekans uzunluğu 2.000 token'ı geçtiğinde FlashAttention-2'den daha hızlı çalışmakta ve benzer büyüklükteki Transformer'a göre 4-5 kat daha yüksek çıkarım verimi sunmaktadır. Bugün SSM'ler ses işleme, genomik dizi analizi, zaman serisi tahmini ve uzun doküman anlama gibi alanlarda güçlü sonuçlar verirken AI21 Labs'ın Jamba modeli gibi Transformer-SSM hibrit mimariler de hızla gelişmektedir.

arrow_forward
linear_scale

Support Vector Machines (SVM) (Destek Vektör Makineleri)

Destek Vektör Makineleri (Support Vector Machines — SVM), sınıflandırma ve regresyon görevleri için geliştirilmiş, teorik temeli sağlam bir denetimli makine öğrenimi algoritmasıdır. Temel fikir basittir: iki sınıfa ait veri noktalarını birbirinden ayıran en geniş kenar boşluğunu (marjı) tanımlayan hiperdüzlemi bulmak. Hiperdüzlem, iki boyutlu uzayda bir doğru, üç boyutlu uzayda bir düzlem ve daha yüksek boyutlarda genel olarak hiperdüzlem adını alır. SVM, bu hiperdüzlemi belirlerken yalnızca sınıra en yakın veri noktalarına — destek vektörlerine — odaklanır; diğer noktalar modeli etkilemez. Geniş marj ilkesi, modelin yeni ve görülmemiş örnekleri daha iyi genelleştireceği güvencesini verir. Gerçek dünyadaki veriler çoğu zaman doğrusal olarak ayrılamaz. SVM bu durumu kernel hilesi (kernel trick) ile aşar: veriyi daha yüksek boyutlu bir uzaya taşıyarak doğrusal ayrım imkânı yaratır. Hesaplama, yüksek boyutta açıkça çalışmadan iç çarpım formülü üzerinden yapılır; bu sayede polinom, RBF (Radial Basis Function) ve sigmoid kernel seçenekleri sunulur. C düzenlileştirme parametresi, marj genişliği ile eğitim hatası arasındaki dengeyi belirler. Küçük C geniş ve hata toleranslı marj üretirken, büyük C dar ama hata açısından titiz bir sınır çizer. RBF kernelde ek olarak gamma parametresi, her veri noktasının etkisi ne kadar uzağa yayıldığını kontrol eder. SVM'nin avantajları arasında yüksek boyutlu uzayda etkili çalışması, küçük-orta ölçekli veri setlerinde güçlü performans sergilemesi ve global optimuma yakınsama garantisi öne çıkar. Öte yandan 100.000 örnekten büyük veri setlerinde eğitim yavaşlar; doğrudan olasılık çıktısı üretmez; çok sınıflı görevler one-vs-rest veya one-vs-one stratejileri gerektirir. Türk makine öğrenimi mühendisleri için SVM, metin sınıflandırmada TF-IDF + LinearSVC kombinasyonu olarak hâlâ geçerli bir baseline sunar. Küçük etiketli veri setlerinde derin öğrenme modelleriyle rekabet edebilir; biyoinformatik ve tıp gibi alanlarda yorumlanabilirlik gereken durumlarda tercih edilir.

arrow_forward
code_blocks

Sürü Zekası (Sürü Zekası)

Sürü zekası (swarm intelligence), bireysel ajanların birbirleriyle ve çevreleriyle yerel etkileşimleri sonucunda gruba özgü kolektif zeka davranışının kendiliğinden ortaya çıkmasını inceleyen hesaplama paradigmasıdır. Terimi, biyolog Guy Theraulaz ve matematikçi Eric Bonabeau 1990'ların başında kavramsallaştırmış; ilham kaynağı ise karınca kolonileri, arı kovanları ve kuş sürülerindeki merkezi koordinasyon olmaksızın gerçekleşen etkin problem çözme davranışıdır. Sürü zekasının iki temel özelliği öne çıkar: birincisi öz-örgütlenme, yani basit bireysel kurallardan küresel yapıların kendiliğinden doğması; ikincisi dağıtık kontrol, yani tek noktada merkezileşmiş otorite olmaksızın işleyen sistemdir. Bu özellikler, sürü tabanlı algoritmaların donanım arızalarına ve ortam değişimlerine karşı yüksek dayanıklılık sergilemesini mümkün kılar. En yaygın sürü zekası algoritmaları şunlardır: Karınca Kolonisi Optimizasyonu (ACO), Marco Dorigo'nun 1992'de önerdiği bu yöntemde yapay karıncalar, feromon izi mantığıyla graflar üzerinde optimal yolları keşfeder. Gezgin satıcı problemi, ağ yönlendirmesi ve lojistik optimizasyonunda başarıyla uygulanmaktadır. Parçacık Sürüsü Optimizasyonu (PSO), Kennedy ve Eberhart'ın 1995'te geliştirdiği bu algoritma kuş ve balık sürüsü davranışından esinlenir; her parçacık, kendi en iyi konumu ve sürünün küresel en iyisi bilgisiyle hareketini günceller. Sürekli optimizasyon problemlerinde ve derin öğrenme hiperparametre ayarında sıklıkla tercih edilir. Yapay Arı Kolonisi (ABC) algoritması, Karaboğa tarafından tasarlanan bu yöntemde keşifçi, sömürücü ve gözetici arı rolleri çok modlu fonksiyonları başarıyla optimize eder. Ateşböceği Algoritması, parlaklık tabanlı iletişim kurallarıyla çok modlu ve yüksek boyutlu problemleri ele alır. Biyolojik temeli itibariyle sürü zekası karmaşıklık teorisi, ortaya çıkış (emergence) ve öz-örgütlenme kavramlarıyla sıkı biçimde ilişkilidir. Stigmerji mekanizması —dolaylı çevre üzerinden koordinasyon— bu paradigmanın ayırt edici unsurudur ve robotik sürü sistemlerinden internet yönlendirme protokollerine kadar geniş bir alana uygulanmaktadır. Günümüzde sürü zekası; nöral mimari araması (NAS), çok-etmenli robot koordinasyonu, akıllı şebeke yönetimi ve otonom araç filolarının denetiminde yeni uygulama alanları bulmaktadır. Pekiştirmeli öğrenme ile birleştirilen hibrit yaklaşımlar, gradyan tabanlı yöntemlerin yetersiz kaldığı süreksiz veya çok modlu arama uzaylarında üstün sonuçlar üretmekte; büyük ölçekli kombinatoryal optimizasyon problemleri için vazgeçilmez bir alternatif olmaya devam etmektedir.

arrow_forward
🔍

Tabu Arama (Tabu Arama)

Tabu Arama (Tabu Search), Fred Glover tarafından 1986 yılında geliştirilen ve 1989'da ORSA Journal on Computing'de yayımlanan meta-sezgisel bir optimizasyon algoritmasıdır. Kombinatoryal optimizasyon problemlerinde yerel aramayı bir üst düzeye taşıyan bu yaklaşım, gezgin satıcı problemi (TSP), iş çizelgeleme ve araç rotalama gibi NP-zor problemlerde kaliteli çözümler üretmektedir. Algoritmanın çekirdeğinde tabu listesi mekanizması yatar. Her adımda mevcut çözümün komşuları değerlendirilir ve tabu listesinde yer almayan en iyi komşuya geçilir. Bu adım anlık çözüm kalitesini geçici olarak düşürebilir; ancak döngüsel arama tuzağının önüne geçer. Tabu listesinin uzunluğu (tabu tenure, genellikle 5–20 adım) kritik bir hiperparametredir: kısa liste çevik fakat döngüye açık, uzun liste ise aşırı kısıtlayıcı olabilir. Reaktif Tabu Arama varyantı bu dengeyi otomatik yöneterek döngü saptandığında tenure'ü uzatır, çeşitlilik arttığında kısaltır. Algoritma iki tür bellek yapısıyla çalışır. Kısa vadeli bellek (tabu listesi) son k hareketi yasaklayarak döngüyü engeller. Uzun vadeli bellek ise iki strateji barındırır: diversifikasyon az keşfedilen bölgelere yönlendirir; yoğunlaştırma umut vaat eden bölgeleri derinlemesine tarar. Bu bellek hiyerarşisi, simüle tavlama gibi tek bellekli yöntemlere kıyasla daha tutarlı sonuçlar ortaya koyar ve büyük arama uzaylarında bile etkin bir tarama gerçekleştirmeyi olanaklı kılar. Aspirasyon kriteri tabu listesinin katılığını yumuşatır: bir hareket tabu statüsünde olsa bile o ana kadar bulunan global en iyi çözümü geçiyorsa kabul edilir. Bu kural aşırı kısıtlamadan kaynaklanan fırsatçı kayıpları engeller ve algoritmanın yüksek kaliteli bölgelere erişimini korur. Tabu Arama, paralel uygulama ve derin öğrenme hibridleriyle de kullanılmaktadır. Paralel Tabu Arama birden fazla başlangıç noktasından eş zamanlı arama yaparak çözüm çeşitliliğini artırır. Günümüzde hiperparametre araması ve sinir mimarisi optimizasyonunda (NAS) Tabu Arama bileşenleri, gradyan tabanlı olmayan etkili bir alternatif olarak değer görmektedir.

arrow_forward
fast_forward

Taslak Model (Taslak Model)

Taslak Model (Draft Model), spekülatif kod çözme (speculative decoding) yönteminde büyük doğrulayıcı modele aday token dizileri öneren küçük ve hızlı dil modelidir. Spekülatif kod çözmenin temel iddiası şudur: büyük modelin her token üretimi için yaptığı hesaplamanın büyük bölümünü küçük bir model ucuza gerçekleştirebilir; büyük model yalnızca bu önerileri toplu biçimde doğrulama veya reddetme rolünü üstlenir. Spekülatif kod çözme sürecinde taslak model γ (genellikle 4–8) adet token sırayla üretir. Ardından büyük doğrulayıcı model bu γ tokeni tek bir ileri geçişte (forward pass) paralel olarak değerlendirir. Kabul veya ret kararı her token için bağımsız olasılık karşılaştırmasıyla verilir; büyük modelin dağılımından belirgin biçimde sapan tokenler reddedilir. Reddedilen ilk token noktasından büyük model sıralı kod çözmeye geri döner. Bu mekanizma modelin çıktı dağılımını değiştirmez; yalnızca gecikme süresini azaltır. Taslak modelin seçimi kritiktir. Büyük modelle aynı model ailesinden gelen küçük bir versiyon (örneğin Llama 3 70B ile doğrulama yapılırken Llama 3 8B taslak olarak kullanılması) yüksek token kabul oranı (token acceptance rate) sağlar; taslak modelin dil dağılımı doğrulayıcıya yakın olduğunda daha az token reddedilir. Farklı mimari veya eğitim verisinden gelen bir model düşük kabul oranına yol açar ve spekülatif kod çözmenin avantajını ortadan kaldırır. Taslak modelin bellek varlığı düşük olduğundan spekülatif kod çözme GPU bellek tüketimini artırsa da net verim kazancı önemlidir: iyi ayarlanmış senaryolarda büyük modelin tek başına çalışmasına kıyasla 2–3 kat hız artışı gözlemlenir. Bu hız artışı, üretim altyapısında kullanıcı bekleme süresini ve token başına düşen maliyet (cost per token) değerini doğrudan etkiler. Farklı taslak model yaklaşımları da mevcuttur. Google'ın Medusa çerçevesi, ayrı bir taslak model yerine doğrulayıcı modelin üstüne ek kafa (head) katmanları ekleyerek aday tokenler üretir; böylece ek bir model yükleme yüküne gerek kalmaz. EAGLE (Extrapolation Algorithm for Greater Language-model Efficiency) ise özellik katmanını doğrudan yeniden kullanan hibrit bir yaklaşım sunar. Her iki yöntem de tek bir modelin içinde spekülatif üretimi mümkün kılar. Üretim ortamlarında (vLLM, TensorRT-LLM, Hugging Face TGI) spekülatif kod çözme eklentiler ya da yerleşik parametreler aracılığıyla etkinleştirilebilir hâle gelmiştir.

arrow_forward
speed

Token Kabul Oranı (Token Kabul Oranı)

Token Kabul Oranı (Token Acceptance Rate), spekülatif kod çözme sistemlerinde taslak modelin önerdiği tokenlerin büyük doğrulayıcı model tarafından kabul edilme yüzdesini ölçen verim metriğidir. Bu oran, spekülatif kod çözmenin pratikte ne kadar etkin çalıştığını değerlendirmenin temel göstergesidir. Spekülatif kod çözmede taslak model γ adet aday token önerir; doğrulayıcı model bunları değerlendirerek kabul veya reddeder. Eğer γ=8 öneride 6 tanesi kabul ediliyorsa token kabul oranı %75'tir. Kabul oranı yüksek olduğunda her doğrulayıcı geçişinden daha fazla yeni token kazanılır; bu durum fiili hız çarpanını artırır. Kabul oranı düştükçe spekülatif kod çözme geleneksel otoregresif kod çözmeye kıyasla avantajını yitirir ve belirli bir eşiğin altında geleneksel kod çözme daha verimli hale gelir. Token kabul oranını etkileyen başlıca faktörler şunlardır: taslak modelin büyük modelle dağılım uyumu (kalibrasyonu), görev tipi, bağlam uzunluğu ve sıcaklık değeri. Aynı model ailesinden seçilen taslak modeller, örneğin LLaMA 3 8B ile LLaMA 3 70B kombinasyonu, dağılım uyumu yüksek olduğundan genellikle %80 üzerinde kabul oranı sağlar. Çeviri ve kod tamamlama gibi tahmin edilebilir görevler yaratıcı metin üretimine kıyasla çok daha yüksek kabul oranı verir. Token kabul oranı ile ortalama kabul uzunluğu (average accepted length, α) arasında doğrudan bir ilişki bulunmaktadır. α değeri her doğrulayıcı geçişinde kabul edilen ortalama token sayısını gösterir ve teorik hız çarpanı (1 + α) olarak hesaplanır. Örneğin α=3 olduğunda teorik hız 4× artar. Pratikte bu değer GPU bellek bant genişliği ve model boyutu gibi donanım faktörlerine bağlı olarak değişir. Üretim sistemlerinde token kabul oranı sürekli izlenmeli ve dinamik γ seçimiyle optimize edilmelidir. Anlık oranda yaşanan düşüş, taslak modelin bağlamı iyi modelleyemediğine ya da sıcaklık ayarının yeniden gözden geçirilmesi gerektiğine işaret edebilir. Medusa kafaları ve SpecDec varyantları gibi ileri teknikler kabul oranını daha da artırırken sistem karmaşıklığını yönetilebilir düzeyde tutmayı hedeflemektedir.

arrow_forward
code_blocks

Viterbi Algorithm (Viterbi Algoritması)

Viterbi Algoritması, 1967 yılında iletişim mühendisi Andrew Viterbi tarafından geliştirilen ve verilen bir gözlem dizisine karşılık gelen en olası gizli durum dizisini bulan dinamik programlama tabanlı bir algoritmadır. Başlangıçta dijital haberleşmede evrişimli kodların etkin biçimde çözülmesi için tasarlanan algoritma, kısa sürede Gizli Markov Modellerinin (HMM) çözümleme problemi için standart çözüm hâline gelmiştir. Algoritmanın temel fikri, olası durum yollarını tek tek değerlendirmek yerine dinamik programlama ilkesiyle her zaman adımında en yüksek olasılıklı kısmi yolu izlemektir. Her zaman adımında, önceki adımların en iyi yolunu hatırlamak için bir iz tablosu (traceback table) tutulur. Çözümleme tamamlandıktan sonra bu tablo geriye doğru taranarak en olası durum dizisi elde edilir. Zaman karmaşıklığı O(T × N²) olup T gözlem uzunluğunu, N ise durum sayısını gösterir; bu değer olası tüm yolları denemekle ortaya çıkan O(Nᵀ) üstel karmaşıklığın yerine geçer ve büyük ölçekte işlem yapmayı mümkün kılar. Konuşma tanımada Viterbi algoritması, akustik model olarak kullanılan HMM'lerin çözümleme adımında fonem sıralamasını belirler. Her ses çerçevesi için olasılıksal akustik özellikler hesaplanır; algoritma bu özelliklerden en olası fonem dizisini türetir. Doğal dil işlemede sözcük türü etiketleme (POS tagging) ve adlandırılmış varlık tanıma (NER) görevlerinde Koşullu Rastsal Alan (CRF) modelleri Viterbi ile çözümlenir. Biyoinformatikte DNA dizi hizalaması, gen segmentasyonu ve protein yapısı tahmini için yaygın biçimde kullanılır. Derin öğrenme çağında Viterbi algoritması, CTC (Connectionist Temporal Classification) ve CRF katmanlarıyla birleştirilerek modern konuşma tanıma ve dizi etiketleme sistemlerinde yer almaya devam etmektedir. Algoritmanın değişmez popülerliği; garantili optimal çözüm üretmesi, deterministik ve öngörülebilir çalışma süresi ile sınırlı bellek gereksinimiyle açıklanabilir. Günümüzde ESPnet ve Kaldi gibi konuşma teknolojisi araç setleri Viterbi tabanlı çözümleme modüllerini üretim sistemlerinde etkin biçimde kullanmaktadır.

arrow_forward