tag deep-learning
AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)
Bu sayfada deep-learning (AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)) etiketi ile işaretlenmiş 17 yapay zeka kavramını bulabilirsiniz.
AI Hızlandırıcı (İng. AI Accelerator), derin öğrenme ve makine öğrenimi iş yüklerini geleneksel merkezi işlem birimlerine (CPU) kıyasla çok daha verimli ve hızlı işlemek amacıyla geliştirilmiş özel amaçlı donanım birimleridir. Yapay zeka modellerinin eğitim ve çıkarım (inference) aşamalarında milyarlarca matris çarpımı, vektör toplama ve aktivasyon fonksiyonu hesabı gerçekleştirilir; bu işlemler genel amaçlı CPU mimarilerinde ciddi darboğazlar oluşturur. AI hızlandırıcılar, sinir ağı operasyonlarına doğrudan optimize edilmiş paralel işlem birimleri ve özel bellek mimarileriyle bu sorunu çözer. Bu alanda en yaygın kullanılan türler şunlardır: GPU (Grafik İşlem Birimi) — binlerce küçük çekirdeğiyle yüksek paralel işlem kapasitesi sunan ilk popüler AI hızlandırıcı; TPU (Tensör İşlem Birimi) — Google'ın TensorFlow iş yükleri için geliştirdiği özel ASIC; NPU (Sinirsel İşlem Birimi) — akıllı telefon ve IoT cihazlarına entegre, düşük güçte çıkarım yapan çip; FPGA (Sahaya Programlanabilir Kapı Dizisi) — yeniden yapılandırılabilir mimarisiyle esnek optimizasyon imkânı sunan donanım; ASIC (Uygulamaya Özel Entegre Devre) — tek bir iş yükü için tasarlanmış, en yüksek verimlilik oranına ulaşan çip. Hızlandırıcıların performansı; saniyede gerçekleştirilebilen kayan noktalı işlem sayısı (TFLOPS), yüksek bant genişlikli bellek (HBM) kapasitesi, bellek bant genişliği ve chip-to-chip iletişim hızı (NVLink, InfiniBand) gibi metriklerle ölçülür. Enerji verimliliği FLOPS/Watt biriminde ifade edilir ve veri merkezi işletme maliyetlerini doğrudan etkiler. Büyük dil modelleri (LLM) trilyonlarca parametreye ulaştıkça yüzlerce ila binlerce hızlandırıcının NVLink veya InfiniBand ile birbirine bağlandığı kümeler (accelerator clusters) ortaya çıkmıştır. NVIDIA H100/H200 Hopper ve Blackwell serileri, Google Trillium (TPU v6), AWS Trainium2 ve Groq LPU günümüz yapay zeka altyapısının bel kemiğini oluşturmaktadır. Öte yandan uç yapay zeka (edge AI) alanında NPU'lar akıllı telefon, güvenlik kamerası ve araç içi sistemlere gömülerek bulut bağlantısı gerektirmeden gerçek zamanlı çıkarım yapabilmektedir. Bu iki eğilim — bulut kümelerindeki devasa ölçek ve uçtaki düşük güçlü çıkarım — modern AI hızlandırıcı ekosisteminin iki kutbunu tanımlamaktadır.
AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)
AI Hızlandırıcı (İng. AI Accelerator), derin öğrenme ve makine öğrenimi iş yüklerini geleneksel merkezi işlem birimlerine (CPU) kıyasla çok daha verimli ve hızlı işlemek amacıyla geliştirilmiş özel amaçlı donanım birimleridir. Yapay zeka modellerinin eğitim ve çıkarım (inference) aşamalarında milyarlarca matris çarpımı, vektör toplama ve aktivasyon fonksiyonu hesabı gerçekleştirilir; bu işlemler genel amaçlı CPU mimarilerinde ciddi darboğazlar oluşturur. AI hızlandırıcılar, sinir ağı operasyonlarına doğrudan optimize edilmiş paralel işlem birimleri ve özel bellek mimarileriyle bu sorunu çözer. Bu alanda en yaygın kullanılan türler şunlardır: GPU (Grafik İşlem Birimi) — binlerce küçük çekirdeğiyle yüksek paralel işlem kapasitesi sunan ilk popüler AI hızlandırıcı; TPU (Tensör İşlem Birimi) — Google'ın TensorFlow iş yükleri için geliştirdiği özel ASIC; NPU (Sinirsel İşlem Birimi) — akıllı telefon ve IoT cihazlarına entegre, düşük güçte çıkarım yapan çip; FPGA (Sahaya Programlanabilir Kapı Dizisi) — yeniden yapılandırılabilir mimarisiyle esnek optimizasyon imkânı sunan donanım; ASIC (Uygulamaya Özel Entegre Devre) — tek bir iş yükü için tasarlanmış, en yüksek verimlilik oranına ulaşan çip. Hızlandırıcıların performansı; saniyede gerçekleştirilebilen kayan noktalı işlem sayısı (TFLOPS), yüksek bant genişlikli bellek (HBM) kapasitesi, bellek bant genişliği ve chip-to-chip iletişim hızı (NVLink, InfiniBand) gibi metriklerle ölçülür. Enerji verimliliği FLOPS/Watt biriminde ifade edilir ve veri merkezi işletme maliyetlerini doğrudan etkiler. Büyük dil modelleri (LLM) trilyonlarca parametreye ulaştıkça yüzlerce ila binlerce hızlandırıcının NVLink veya InfiniBand ile birbirine bağlandığı kümeler (accelerator clusters) ortaya çıkmıştır. NVIDIA H100/H200 Hopper ve Blackwell serileri, Google Trillium (TPU v6), AWS Trainium2 ve Groq LPU günümüz yapay zeka altyapısının bel kemiğini oluşturmaktadır. Öte yandan uç yapay zeka (edge AI) alanında NPU'lar akıllı telefon, güvenlik kamerası ve araç içi sistemlere gömülerek bulut bağlantısı gerektirmeden gerçek zamanlı çıkarım yapabilmektedir. Bu iki eğilim — bulut kümelerindeki devasa ölçek ve uçtaki düşük güçlü çıkarım — modern AI hızlandırıcı ekosisteminin iki kutbunu tanımlamaktadır.
DDPM (Gürültü Giderme Difüzyon Olasılık Modeli)
DDPM (Denoising Diffusion Probabilistic Models), Jonathan Ho ve arkadaşları tarafından 2020 yılında yayımlanan ve NeurIPS 2020'de sunulan, modern difüzyon modellerinin temelini atan çığır açıcı bir üretici yapay zeka modelidir. GAN ile kıyaslanabilir görüntü kalitesi sunarken çok daha kararlı bir eğitim sürecine sahip olduğunu kanıtlamış; böylece üretici modelleme araştırmalarının rotasını kalıcı olarak değiştirmiştir. DDPM'nin çalışma prensibi iki karşıt süreç üzerine kuruludur. İleri süreçte (forward process, q) temiz veri x₀'a T adım boyunca kademeli Gaussian gürültü eklenir; β_t parametresiyle kontrol edilen bu süreç sonunda veri, N(0,I) dağılımına — yani saf gürültüye — dönüşür. T değeri genellikle 1.000 olarak seçilir; lineer ya da kosinüs gürültü çizelgesi kullanılır. Kosinüs çizelgesi, son adımlarda aşırı gürültüden kaynaklanan kalite kayıplarını azaltması nedeniyle tercih edilir. Ters süreçte (reverse process, p_θ) ise eğitilmiş bir sinir ağı, gürültülü örnekten başlayarak gerçek veri dağılımını adım adım kurtarır. Bu aşamada U-Net mimarisi her adımda eklenen gürültüyü (ε) tahmin eder; kayıp fonksiyonu sadeleştirilerek basit bir ortalama kare hata formuna, L = E[||ε - ε_θ(x_t, t)||²] biçimine indirgenir. U-Net, zaman adımını sinüs pozisyonel gömme olarak aldığından aynı ağırlıklar T farklı gürültü seviyesinde çalışabilir. Böylece eğitim süreci kararlı hale gelir ve GAN'larda sık görülen adversarial dengesizlik sorunu tamamen ortadan kalkar. DDPM'in akademik etkisi son derece geniştir. DDIM (Song ve ark., 2020) belirleyici örnekleme ile adım sayısını 50'ye indirdi; LDM ve Stable Diffusion gizli uzay üzerinde çalışarak hesaplama maliyetini yaklaşık 48 kat azalttı. DALL-E 2, Imagen ve günümüzdeki Flux modelleri metin-görüntü eşleştirmeyi mükemmelleştirdi. Video, ses ve protein tasarımı alanlarına uyarlanan mimariler de DDPM'in temel ε-prediction formülasyonunu devralmıştır. Görüntü oluşturmanın ötesinde, DDPM'den türeyen modeller ilaç keşfi, iklim modelleme ve ses sentezinde de giderek yaygınlaşmaktadır.
Denoising (Gürültü Giderme (Denoising))
Gürültü giderme (denoising), sinyal işleme ve makine öğreniminde bir veriden istenmeyen bozulmaları veya rastgele gürültüyü kaldırma işlemidir. Görüntü işlemede piksellerdeki rastgele varyasyonları temizlemek, seste arka plan gürültüsünü bastırmak ve zaman serisi verilerinde ani sapmalarını düzeltmek için kullanılır. Derin öğrenmede gürültü giderme özellikle iki bağlamda kritik öneme sahiptir. Birincisi, veri ön işleme: Eğitim verisi gerçek dünya kaynaklı olduğundan gürültü doğaldır; temiz veriyle eğitilen modeller genellikle daha iyi genelleme yapar. İkincisi ve daha çarpıcı olanı, difüzyon modellerinin (Diffusion Models) temel mekanizmasıdır: bu modeller bir görüntüye kademeli olarak Gaussian gürültü ekler (forward process), ardından bu gürültüyü adım adım temizlemeyi öğrenir (reverse process). DALL-E 2, Stable Diffusion ve Flux gibi modeller bu gürültü ekleme-giderme döngüsüne dayanır. Klasik gürültü giderme yöntemleri arasında Gaussian filtresi (blur), Median filtresi, Wiener filtresi ve Non-local Means bulunur. Derin öğrenme tabanlı yaklaşımlar bu yöntemlerin çok ötesine geçti: DnCNN (Denoising Convolutional Neural Network), gürültü seviyesini tahmin eden blind denoising; U-Net mimarisi temelli encoder-decoder yapılar ise piksel düzeyi hassasiyetle gürültü haritası üretir. Difüzyon modellerinde kullanılan score matching ve DDPM (Denoising Diffusion Probabilistic Model) çerçevesi, gürültü gidermeyi olasılıksal bir süreç olarak modelleyen ve T adım boyunca gürültüyü kademeli olarak azaltan yaklaşımdır. Her adımda model, ε-prediction veya x0-prediction hedefiyle eğitilir: gürültü tahmini yaparak temiz sinyale ulaşır. Bu yapı, yalnızca görüntü değil; ses sentezi (WaveNet), video üretimi ve 3D nokta bulutu oluşturma alanlarında da temel teknik olarak benimsenmiştir. DDIM örnekleyici ise az adımla deterministik gürültü giderme yaparak çıkarım hızını önemli ölçüde artırır. Latent Diffusion modelleri bu süreci VAE ile sıkıştırılmış latent uzayda yürütür; böylece piksel uzayına kıyasla hesaplama maliyeti dramatik biçimde düşer ve 512×512 görüntü üretimi tüketici GPU'larında mümkün hâle gelir. Flow Matching (Flux'un kullandığı yöntem) ise forward süreci daha kısa ve düz bir eğriyle tanımlayarak DDPM'e kıyasla hem daha hızlı hem daha kaliteli gürültü giderme yapabilmektedir.
Dropout (Düzenlileştirme Tekniği)
Dropout, derin sinir ağı eğitimi sırasında her güncelleme adımında belirli bir olasılıkla (dropout oranı, p) gizli katman nöronlarının çıkışlarını sıfırlayan ve bu şekilde modelin belirli nöronlara bağımlılığını kıran bir düzenlileştirme tekniğidir. 2014 yılında Srivastava ve arkadaşları tarafından önerilen bu yöntem, derin öğrenme tarihinin en etkili yeniliklerinden biri olarak kabul görmektedir. Temel fikir, eğitim sırasında ağı sürekli değişen rastgele alt ağlar üzerinde çalıştırarak her nöronun diğer nöronların varlığına ya da yokluğuna göre hareket etmeyi öğrenmesini önlemektir. Bu mekanizma, ko-adaptasyonu (co-adaptation) kırar ve her nöronu bağımsız olarak yararlı özellikler çıkarmaya zorlar. Ağ böylece tek bir nörona veya nöron grubuna aşırı güvenmek yerine dağıtık temsiller öğrenir. Pratikte dropout oranı p=0.5, tam bağlı katmanlar için standart başlangıç noktası olarak yaygın biçimde kullanılmaktadır. Ancak giriş katmanlarında p=0.1-0.2, konvolüsyonel katmanlarda daha düşük değerler tercih edilir; bu katmanlarda zaten az parametre bulunduğundan çok yüksek dropout aşırı bilgi kaybına yol açabilir. Batch normalization ile birlikte kullanıldığında dikkatli olmak gerekir; ikisi arasındaki etkileşim bazen istenmeyen davranışlara neden olabilmektedir. Test aşamasında dropout tamamen devre dışı bırakılır; tüm nöronlar aktif kalır. Ağırlıklar eğitim sırasında kullanılan seyrelmeyi telafi etmek için (1−p) çarpanıyla ölçeklenir. Modern çerçeveler "inverted dropout" uygular: eğitim sırasında kalan nöronların çıkışları 1/(1−p) ile çarpılır, böylece test aşamasında ekstra işlem gerekmez. PyTorch'ta torch.nn.Dropout(p=0.5) ve Keras'ta layers.Dropout(0.5) ile tek satırda eklenir. Dropout ayrıca Bayesian derin öğrenmeyle de ilişkilendirilmektedir. Test zamanında da dropout açık tutularak birden fazla tahmin yapılırsa (MC Dropout), bu tahminlerin dağılımı modelin belirsizliğine dair istatistiksel bilgi üretir. Özellikle tıbbi teşhis ve otonom araç gibi güvenlik açısından kritik uygulamalarda bu özellik son derece değerlidir. Spatial Dropout ise konvolüsyonel ağlarda tüm özellik haritası kanallarını sıfırlayarak uzamsal bağıntıları daha etkili biçimde kırmaktadır.
Görüntü Segmentasyonu (Görüntü Segmentasyonu)
Görüntü segmentasyonu, bir dijital görseli anlamlı bölgelere veya nesnelere ayıran, yapay zeka ve bilgisayarlı görü alanının temel işlemlerinden biridir. Ham piksel verisi üzerinde çalışan bu işlem, her pikseli belirli bir sınıfa ya da nesne örneğine atar; böylece bir görüntü içindeki farklı nesne ve yüzeylerin sınırları hassas biçimde belirlenir. Segmentasyon, yalnızca nesne tespitinin (object detection) ötesine geçer: sınırlayıcı kutu (bounding box) yerine nesnenin tam piksel maskesini üretir. Üç ana segmentasyon türü mevcuttur. Semantik segmentasyon, her pikseli bir sınıf etiketiyle işaretler; aynı sınıftaki tüm nesneler tek bir bölge olarak ele alınır. Örneğin bir sokak sahnesinde tüm arabalar tek renk, tüm yayalar başka bir renk ile gösterilir. Instance segmentasyon ise bu yaklaşımı bir adım ileri taşır: aynı sınıftan her nesneyi ayrı bir örnek olarak ayırt eder. İki araba yan yana dursa bile her biri kendi maskesine sahip olur. Panoptik segmentasyon ise semantik ve instance segmentasyonu birleştirerek hem sayılabilen nesnelere (araba, insan) hem de arka plan bölgelerine (yol, gökyüzü) piksel düzeyinde etiket atar. Modern segmentasyon mimarileri derin öğrenmeye dayanır. FCN (Fully Convolutional Network) ile başlayan süreç, U-Net ve SegNet gibi encoder-decoder mimarileriyle olgunlaşmıştır. Transformer tabanlı SegFormer ve Mask2Former, dikkat mekanizmalarını kullanarak küresel bağlamı daha iyi modelleyerek önceki CNN yaklaşımlarını geride bırakmıştır. Meta tarafından geliştirilen SAM (Segment Anything Model) ise herhangi bir nesneyi sıfır görüntüyle (zero-shot) segmente edebilen evrensel bir model olarak alanda çığır açmıştır. Görüntü segmentasyonu; tıbbi görüntülemede tümör ve organ sınırlarının tespiti, otonom araçlarda yol ve engel ayrımı, uydu görüntülerinde arazi örtüsü sınıflandırması, artırılmış gerçeklikte arka plan kaldırma ve endüstriyel kalite kontrolünde kusur tespiti gibi kritik uygulamalarda kullanılmaktadır. Performans ölçütü olarak mIoU (mean Intersection over Union) ve Dice katsayısı yaygın şekilde benimsenmektedir.
TensorFlow (TensorFlow)
TensorFlow, Google Brain ekibinin 2015 yılında Apache 2.0 lisansıyla açık kaynak olarak yayımladığı, makine öğrenimi ve derin öğrenme modellerini geliştirmek, eğitmek ve üretime almak için kullanılan uçtan uca bir kütüphanedir. GitHub'da 190 binden fazla yıldıza ulaşan proje, hem araştırma prototiplerini hem de milyarlarca kullanıcıya hizmet veren üretim sistemlerini aynı altyapı üzerinde çalıştırır. İsim, iki kavramın birleşiminden gelir: **tensor**, çok boyutlu sayı dizilerini (skaler, vektör, matris ve daha yüksek boyutlar) temsil eden temel veri yapısıdır; **flow** ise bu tensörlerin bir hesaplama grafiği üzerindeki akışını anlatır. Grafikteki her düğüm bir matematiksel işlemdir; otomatik türev (autodiff) mekanizması bu grafik üzerinden gradyanları hesaplayarak geri yayılımı (backpropagation) otomatikleştirir. TensorFlow 1.x'in statik graf ve `session` yapısı öğrenmeyi zorlaştırıyordu. 2019'daki TensorFlow 2.0, eager execution'ı varsayılan yaptı ve Keras'ı resmi yüksek seviyeli API olarak benimsedi; böylece bir görüntü sınıflandırma modeli 10 satırın altında kodla tanımlanabilir hale geldi. `tf.function` dekoratörü ise aynı kodu XLA derleyicisiyle optimize edilmiş grafa çevirerek Python esnekliği ile graf performansını birleştirir. Donanım desteği kütüphanenin en güçlü yanlarından biridir: CPU, NVIDIA GPU (CUDA), Apple Silicon (Metal) ve Google'ın kendi tasarladığı TPU'larda aynı kod çalışır. TPU v5e ve sonrası pod'larda binlerce çipe ölçeklenen dağıtık eğitim, `tf.distribute` API'siyle birkaç satırlık değişiklikle kurulur. 2026 itibarıyla güncel kararlı sürüm TensorFlow 2.21 serisidir; NumPy 2.x uyumluluğu ve uç cihazlar için int2/int4 kuantizasyon desteği bu dönemde eklendi. Mobil tarafta TensorFlow Lite, Google AI Edge çatısı altında LiteRT adıyla bağımsız bir projeye dönüştü ve artık TensorFlow'un yanı sıra PyTorch ile JAX modellerini de çalıştırıyor. Keras 3 ise çoklu-backend mimarisiyle aynı model kodunun TensorFlow, JAX veya PyTorch üzerinde koşmasına imkân tanıyor; Google'ın araştırma tarafında JAX'e yönelmesine karşın TensorFlow üretim dağıtımı, TF Serving ve TFX boru hatlarıyla kurumsal tarafta konumunu koruyor. Kütüphaneyi tek başına bir araçtan çok bir ekosistem olarak düşünmek gerekir. Model geliştirme Keras ile, eğitim izleme TensorBoard ile, veri boru hatları `tf.data` API'siyle, üretim servisleme TF Serving ile, uçtan uca MLOps süreçleri ise TFX ile yönetilir. Tarayıcıda çalışan TensorFlow.js, sunucuya veri göndermeden gizlilik dostu çıkarım yapar; TensorFlow Hub ve Kaggle Models üzerindeki binlerce önceden eğitilmiş model, transfer öğrenmeyle özel bir görevi birkaç saatlik eğitimle çözmeye yeter. Bu bütünlük, tek bir prototipin veri hazırlığından mobil uygulamadaki çıkarıma kadar aynı araç zincirinde ilerlemesini mümkün kılar. Google Arama, YouTube öneri motoru, Google Translate, Airbnb, Uber, Twitter/X ve Spotify gibi sistemlerde üretimde kullanılan TensorFlow; bilgisayarlı görü, doğal dil işleme, öneri sistemleri, zaman serisi tahmini ve konuşma tanıma alanlarında sektör standardı araç zincirleri sunar. Python birincil dil olmakla birlikte C++, JavaScript (TensorFlow.js) ve Java/Kotlin (LiteRT) ile de model çalıştırılabilir. Yeni başlayanlar için resmi tensorflow.org eğitimleri, ücretsiz GPU sunan Google Colab not defterleri ve Coursera'daki TensorFlow Developer sertifika programları en yaygın öğrenme yollarıdır; temel Python ve lise düzeyi lineer cebir bilgisi ilk çalışan modeli eğitmek için çoğu durumda fazlasıyla yeterlidir.
Video Süper Çözünürlük (VSR) (Video Süper Çözünürlük)
Video Süper Çözünürlük (Video Super-Resolution, VSR), düşük çözünürlüklü video karelerini derin öğrenme modelleri aracılığıyla yüksek çözünürlüklü videolara dönüştüren bir yapay zeka teknolojisidir. Geleneksel yükseltme yöntemleri enterpolasyon (bilineer, çift kübik) kullanırken VSR modelleri, hem tek bir karedeki uzamsal bilgiyi hem de ardışık kareler arasındaki zamansal ilişkiyi öğrenerek gerçekçi doku ve kenar detayları sentezler. VSR sistemleri temel olarak iki kategoriye ayrılır: tekrarlayan ağlar (recurrent networks) ve kayar pencere (sliding window) yaklaşımları. Tekrarlayan ağlar, önceki ve sonraki karelerin bilgisini gizli durum vektörlerinde biriktirir; EDVR ve BasicVSR bu kategorinin öncü örnekleridir. EDVR (Enhanced Deformable convolutional Networks for Video Restoration), deformable convolution v2 ile hassas çok-ölçekli hizalama yaparak CVPR NTIRE 2019 Yarışması'nda birinci olmuştur. BasicVSR ve devamı BasicVSR++ (Wang ve ark., 2021-2022), çift yönlü yayılım ve optik akış tabanlı hizalamayı basit ama güçlü bir çerçevede birleştirerek açık kaynak referans mimari konumuna gelmiştir. Model mimarileri açısından konuşursak: uzamsal özellik çıkarımı için derin CNN veya Swin Transformer katmanları kullanılırken zamansal bilgi gizli durum veya kayar pencere mekanizmalarıyla aktarılır. Son aşamada pixel shuffle (alt piksel konvolüsyon) katmanı, özellik haritasını yüksek çözünürlüklü piksel ızgarasına çevirir. Optik akış tahmini veya deformable convolution ile karelar arası piksel ötelenmeleri hizalanır; bu hizalama adımı birden fazla kareden gelen doku bilgisinin birleştirilmesini mümkün kılar. Son yıllarda difüzyon tabanlı ve GAN tabanlı yaklaşımlar hız kazanmaktadır. DiffVSR, difüzyon modellerini temporal tutarlılık kısıtlamalarıyla birleştirerek gerçek dünya bozulmalarına karşı güçlü sonuçlar üretir. VideoGigaGAN (Adobe Research, 2024) ise büyük ölçekli GAN mimarisini video domainine taşıyarak 8× büyütmede çarpıcı doku zenginliği sunar. VSR, OTT arşivi upscaling, dijital yayıncılık, güvenlik kameraları, tıbbi görüntüleme ve tarihi film restorasyonu gibi geniş bir yelpazede uygulanmaktadır. Kalite değerlendirmesinde PSNR ve SSIM yanı sıra LPIPS ve NIQE gibi algısal metrikler de kullanılmaktadır.
Voice Activity Detection (VAD) (Ses Aktivite Tespiti)
Ses Aktivite Tespiti (Voice Activity Detection — VAD), bir ses sinyalinde herhangi bir anda konuşma bulunup bulunmadığını otomatik olarak belirleyen bir sinyal işleme ve yapay zeka tekniğidir. VAD, ses akışını anlık olarak analiz ederek konuşma içeren bölümleri (aktif segmentler) arka plan gürültüsünden, sessizlikten veya müzikten ayırt eder. VAD'ın temel görevi, konuşmanın başladığı ve bittiği anları hassas biçimde saptamaktır. Bu bilgi; otomatik konuşma tanıma (ASR), konuşmacı ayrıştırma (speaker diarization), metinden sese (TTS) sistemleri ve VoIP iletişimi gibi uygulamalarda kritik bir ön işleme adımı olarak kullanılır. Geleneksel yaklaşımlarda VAD, enerji eşikleri veya sıfır geçiş hızı (zero-crossing rate) gibi el ile tasarlanmış sinyal özelliklerine dayanırdı. Ancak modern VAD sistemleri derin öğrenme modellerinden — özellikle LSTM ve evrişimsel sinir ağlarından (CNN) — yararlanarak gürültülü ortamlarda bile yüksek doğruluk sağlar. Silero VAD ve WebRTC VAD gibi açık kaynaklı kütüphaneler, gerçek zamanlı uygulamalarda yaygın biçimde tercih edilmektedir. VAD'ın pratik önemi birçok boyutta kendini gösterir. İlk olarak, yalnızca aktif konuşma segmentlerini işleyerek hesaplama maliyetini önemli ölçüde düşürür — bir ASR motoru sessiz dilimleri işlemek yerine kaynakları yalnızca anlamlı bölümlere tahsis eder. İkinci olarak, iletişim uygulamalarında bant genişliği tasarrufu sağlar: VoIP sistemleri sessiz dönemlerde veri paketi göndermeyerek ağ trafiğini azaltır. Üçüncü olarak, konuşmacı ayrıştırma ve toplantı transkripsiyonu gibi ileri aşamalı görevlerin doğruluğunu artırır. Son yıllarda büyük çaplı ses-metin modellerinin (OpenAI Whisper gibi) yaygınlaşmasıyla VAD, uçtan uca ses işleme boru hatlarında (end-to-end pipelines) giderek daha merkezi bir rol üstlenmektedir. Bilhassa uzun ses kayıtlarını yönetilebilir parçalara bölme ve her segmenti bağımsız olarak işleme sürecinde VAD zorunlu bir ara katman işlevi görür. Model boyutu ve gecikme (latency) arasındaki denge, VAD seçimini doğrudan etkileyen temel tasarım parametresidir.
VRAM (GPU Belleği)
VRAM (Video RAM), GPU'nun (grafik işlemci birimi) üzerinde bulunan ve model ağırlıkları, aktivasyonlar ile ara hesaplama verilerini tutan yüksek bant genişlikli bellektir. Sistem RAM'i CPU'ya hizmet ederken VRAM doğrudan GPU çekirdeklerine bağlıdır ve GDDR7 ile 1 TB/s'nin üzerinde, HBM3e ile 8 TB/s'ye varan veri aktarım hızına ulaşır. Bu hız farkı, binlerce çekirdeğin aynı anda veri beklediği paralel hesaplamada belirleyicidir. Yapay zeka tarafında VRAM, çalıştırılabilecek modelin üst sınırını çizen ana donanım kısıtıdır. Bir büyük dil modelinin (LLM) tüm ağırlıkları çıkarım sırasında VRAM'e yüklenir: 7B parametreli bir model FP16 hassasiyetle yaklaşık 14 GB, 4-bit kuantizasyonla 4-5 GB yer kaplar; 70B sınıfı bir model ise FP16'da 140 GB isteyip INT4 ile 35-40 GB'a iner. Ağırlıkların üzerine, bağlam uzunluğuyla büyüyen KV cache ve batch verisi eklenir; 128K token bağlam tek başına gigabaytlarca ek VRAM tüketebilir. Kapasite aşıldığında model ya hiç yüklenmez ya da sistem RAM'ine taşarak (CPU offload) on kata varan yavaşlamayla çalışır. 2026 itibarıyla kapasite yelpazesi geniştir: tüketici tarafında RTX 5090 32 GB GDDR7, RTX 4090 24 GB sunar; veri merkezinde H100 80 GB, H200 141 GB, Blackwell B200 ise 192 GB HBM3e taşır. Apple Silicon farklı bir yol izler: M3 Ultra'da 512 GB'a çıkan birleşik bellek (unified memory), CPU ve GPU tarafından ortak kullanılır ve ayrı VRAM kavramını ortadan kaldırır. Eğitim senaryolarında VRAM ihtiyacı çıkarımın çok üzerine çıkar; geri yayılım aktivasyonları ve Adam optimizer durum tensörleri parametrelerin 3-4 katı ek bellek tüketir. LoRA ve QLoRA gibi parametre verimli ince ayar yöntemleri bu kısıtlamayı önemli ölçüde hafifletir. Gradyan kontrol noktası alma (gradient checkpointing) tekniği ise bellek-hesaplama takasıyla daha büyük batch boyutlarına izin verir. Yerel LLM çalıştırma, Stable Diffusion/Flux ile görüntü üretme veya LoRA ince ayarı planlayan herkes için ilk sorulacak soru işlemci hızı değil, kaç GB VRAM olduğudur. Model seçiminden donanım alımına kadar her kararda VRAM kapasitesi belirleyici etkendir.
Graph Attention Network (GAT) (Dikkat Mekanizmalı Çizge Sinir Ağı)
Graph Attention Network (GAT), çizge (graf) yapılı verilere dikkat mekanizması uygulayan bir yapay sinir ağı mimarisidir. Velickovic ve ekibi tarafından 2018'de ICLR konferansında önerilen GAT, bir düğümün temsilini güncellerken komşu düğümlere sabit ağırlık atamak yerine, her komşu için ayrı dikkat puanları hesaplayarak hangi komşuların daha önemli olduğunu veri odaklı biçimde öğrenir. GAT, bir düğüm ile her komşusu arasında dikkat katsayısı (attention coefficient) hesaplar. Bu katsayılar Leaky ReLU aktivasyonlu küçük bir sinir ağıyla üretilir ve softmax ile normalize edilir. Son düğüm temsili, komşu özelliklerinin bu ağırlıklı toplamından oluşur. Kararlılık ve farklı ilişki örüntülerini yakalamak için çok başlıklı dikkat (multi-head attention) kullanılır; ara katmanlarda başlık çıktıları birleştirilir, çıkış katmanında ortalaması alınır. Çizge Evrişimsel Ağ (GCN), tüm komşulara eşit ağırlık atarken GAT her komşunun önem derecesini veri odaklı biçimde öğrenir. Bu esneklik, değişken büyüklükteki komşuluk yapılarında ve karmaşık ilişkilerde GAT'a belirgin üstünlük sağlar. GNN (Graph Neural Network) ise bu tür tüm çizge sinir ağlarını kapsayan üst terimdir; GCN ve GAT, GNN'nin özel türleridir. GAT başlıca düğüm sınıflandırma, bağlantı tahmini ve çizge sınıflandırma görevlerinde kullanılır. Pratik uygulamalar arasında sosyal ağ analizi, ilaç-protein etkileşim tahmini, moleküler biyoloji, bilgi grafiği tamamlama ve içerik tabanlı öneri sistemleri yer alır. Dikkat katsayıları komşular arasında paralel hesaplandığı için GAT verimlidir ve farklı büyüklükteki komşuluklara doğal uyum sağlar. Üretilen dikkat ağırlıkları yorumlanabilir olduğundan hangi komşuların belirleyici olduğu analiz edilebilir. Türkiye'de ilaç keşfi ve biyoinformatik alanında çalışan araştırma grupları GAT mimarisini aktif olarak kullanmaktadır. GAT'ın 2021'de önerilen GATv2 varyantı, orijinal mimarideki statik dikkat hesabı sorununu gidererek her adımda tam dinamik dikkat üretir. PyTorch Geometric'in GATConv ve GATv2Conv katmanları, araştırmacılara hazır ve optimize edilmiş implementasyonlar sunar. Büyük çizgelerde ölçeklenebilirlik sorunu için mini-batch örnekleme ve Sparse GAT yaklaşımları yaygınlaşmaktadır; bu varyantlar yalnızca seyrek kenar kümeleriyle çalışarak bellek tüketimini önemli ölçüde azaltır.
Intel Gaudi (Intel Gaudi)
Intel Gaudi, Intel'in 2019 yılında yaklaşık 2 milyar dolara satın aldığı İsrailli yapay zeka çip firması Habana Labs tarafından geliştirilen AI hızlandırıcı serisidir. Seri, derin öğrenme modellerinin eğitimi ve büyük dil modellerinin çıkarımı (inference) için özel olarak tasarlanmıştır. Gaudi 3, serinin en güncel neslidir. TSMC'nin 5 nm süreci üzerinde üretilmektedir. 64 Tensör İşlem Çekirdeği (TPC) ve 8 Matris Çarpma Motoru (MME) barındırır. Bellek tarafında 128 GB HBM2E ve 3,7 TB/s bant genişliği sunar. Ağ bağlantısı için 24 adet 200 GbE bağlantı noktası entegre edilmiş olup küme düzeyinde 9,6 Tbps çift yönlü bant genişliği sağlar. BF16/FP8 operasyonlarında 1.835 TFLOPS hesaplama kapasitesi sunan Gaudi 3, NVIDIA H100 ve H200 karşısında fiyat-performans avantajıyla konumlandırılmaktadır; birim fiyatı H100'ün belirgin şekilde altındadır. Intel'in yayımladığı kıyaslama verilerine göre LLaMA ve Mistral gibi büyük dil modellerinde H100'e kıyasla 2 kat daha yüksek çıkarım hızı elde edilmektedir. Gaudi'nin önemli bir özelliği, standart Ethernet ağ mimarisini kullanmasıdır. NVLink gibi tescilli ağ çözümlerine gerek kalmadan çok düğümlü kümeler kurulmasını mümkün kılar. Yazılım ekosistemi PyTorch, TensorFlow ve Intel'in kendi SynapseAI SDK'sı üzerine kuruludur. AWS DL1 ve DL2 bulut örnekleri, IBM Cloud ve Supermicro sunucularında kullanıma sunulmuştur. Temel zorluk, NVIDIA'nın CUDA ekosistemine kıyasla mevcut yapay zeka kütüphanelerinin büyük bölümünün öncelikle CUDA için optimize edilmiş olmasıdır. Geliştiricilerin Gaudi'ye geçişte mevcut kodlarını uyarlamaları gerekmektedir. Bu durum, kurumsal benimsemede önemli bir sürtünme noktası olmayı korumaktadır.
Konuşmacı Tanıma (Konuşmacı Tanıma)
Konuşmacı Tanıma (Speaker Recognition), ses sinyalinden bir kişinin kimliğini belirlemeye yarayan biyometrik yapay zeka teknolojisidir. İki temel göreve ayrılır: konuşmacı doğrulama (speaker verification) — iddia edilen kimliğin doğruluğunu sınar ("Bu ses gerçekten Ali mi?") ve konuşmacı tanımlama (speaker identification) — önceden tanımlı bir havuzdaki kişiler arasından en yakın eşleşmeyi bulur. Konuşmacı tanıma, konuşma içeriğinden bağımsızdır; yani söylenen kelimeleri değil, sesin bireysel akustik özelliklerini analiz eder. Tarihsel olarak Gaussian Karışım Modeli ile Evrensel Arka Plan Modeli (GMM-UBM) kombinasyonu yıllarca standart yöntem olarak kullanıldı. 2010'ların ortasında derin öğrenmenin yükselişiyle i-vector ve ardından x-vector yaklaşımları öne çıktı; bu yaklaşımlar ham ses özelliklerinden otomatik olarak ayırt edici vektör temsilleri öğrenir. Günümüzde ECAPA-TDNN (Emphasized Channel Attention, Propagation and Aggregation in TDNN) mimarisi sektörde önde gelen doğruluk oranlarını sunmaktadır. Sistem üç aşamalı bir boru hattı izler: ses ön işleme (gürültü azaltma, ses etkinlik tespiti), öznitelik çıkarımı (MFCC, log-mel spektrogram veya öğrenilmiş filterbank'lar) ve gömülü vektör karşılaştırma (kosinüs benzerliği ya da PLDA skorlaması). Gömülü vektör, konuşmacının sabit boyutlu "ses parmak izi" olarak veritabanında saklanır ve kimlik doğrulama sırasında canlı kayıtla karşılaştırılır. Güvenlik açısından sahtecilik (spoofing) saldırıları kritik bir tehdit oluşturur. Metin okuma sentezi (TTS), ses dönüşümü (voice conversion) ve tekrar oynatma (replay) saldırılarına karşı özelleşmiş anti-spoofing modülleri geliştirilmiştir. VoxSRC ve ASVspoof yarışma serileri bu alandaki araştırma yönünü belirlemektedir. Öz-denetimli öğrenme modelleri (WavLM, HuBERT) sayesinde büyük etiketlenmemiş ses külliyatıyla önceden eğitilen sistemler, küçük etiketli veri kümeleriyle ince ayar yapılarak yüksek doğruluk elde etmektedir. Gerçek zamanlı konuşmacı diarizasyonu sistemleri, toplantı transkripsiyon uygulamalarında birden fazla konuşmacıyı milisaniye düzeyinde gecikmeyle ayırt edebilmektedir.
Natural Language Processing (Doğal Dil İşleme)
Doğal Dil İşleme (NLP — Natural Language Processing), bilgisayarların insan dilini anlama, yorumlama, üretme ve anlamlı biçimde yanıt verme yeteneğini geliştiren yapay zeka dalıdır. Dilbilim, bilgisayar bilimi ve makine öğreniminin kesişim noktasında yer alan NLP, günümüzde ChatGPT gibi sohbet robotlarından Google Arama'ya, otomatik çeviriden sesli asistanlara kadar geniş bir kullanım alanına ulaşmıştır. NLP'nin temel işlem hattı birkaç katmandan oluşur: tokenizasyon (metni sözcük veya alt-sözcük parçalarına ayırma), morfolojik analiz (kelime köklerini ve eklerini çözümleme), sözdizimi çözümlemesi (cümle yapısını ağaçla modelleme) ve anlambilimsel analiz (bağlamı ve niyeti kavrama). Modern derin öğrenme yaklaşımları bu aşamaları büyük ölçüde bütünleşik sinir ağlarıyla uçtan uca öğrenir; BERT ve GPT serisi bu dönüşümün simgesi haline gelmiştir. Türkçe, sondan eklemeli (agglutinative) morfolojisi nedeniyle NLP için özellikle zorlu bir dildir. "Gidebileceklerinden" gibi tek bir sözcük onlarca anlam katmanı barındırabilir. BERTurk, Turkish GPT ve Zemberek gibi projeler Türkçe özelinde çözümler geliştirirken, Byte Pair Encoding (BPE) ve SentencePiece alt-sözcük tokenizasyonu dil modellerinin Türkçeyi verimli işlemesini mümkün kılmaktadır. 2017'de yayımlanan Transformer mimarisi NLP'yi köklü biçimde dönüştürdü: öz-dikkat mekanizması ile modeller uzun menzilli bağımlılıkları yakalayabildi. BERT (2018), GPT-3 (2020) ve ChatGPT (2022) bu dönüşümün kilometre taşlarıdır. Günümüzde büyük dil modelleri (LLM) NLP görevlerinin büyük çoğunluğunda insan düzeyine yaklaşmış ya da aşmıştır. NLP; metin sınıflandırma, adlandırılmış varlık tanıma, makine çevirisi, duygu analizi, soru-cevap sistemleri ve özetleme başta olmak üzere onlarca kritik uygulamaya güç vermektedir. Endüstride NLP bileşenleri yaygın biçimde kullanılmaktadır: müşteri hizmetlerinde chatbot ve otomasyon, hukuk teknolojisinde belge tarama, sağlık alanında klinik not çözümleme ve ilaç literatürü analizi. Retrieval-Augmented Generation (RAG) mimarisinde NLP katmanları, kullanıcı sorgusunu vektör uzayında temsil edip ilgili belgeleri alır; böylece LLM'in güncel ve doğru yanıtlar üretmesi desteklenir. Türkiye'de e-devlet platformları, fintech uygulamaları ve yerli yapay zeka girişimleri Türkçe NLP altyapısına giderek artan yatırım yapmaktadır.
Quantum Machine Learning (Kuantum Makine Öğrenimi)
Quantum Machine Learning (QML — Kuantum Makine Öğrenimi), kuantum hesaplama ilkeleriyle klasik makine öğrenmesi algoritmalarını birleştiren disiplinlerarası bir araştırma alanıdır. QML, kuantum bilgisayarların süperpozisyon, dolanıklık (entanglement) ve girişim (interference) özelliklerinden yararlanarak belirli öğrenme ve optimizasyon görevlerini klasik bilgisayarlara kıyasla daha hızlı ya da daha verimli biçimde gerçekleştirmeyi hedefler. Kuantum bitleri (kübit), süperpozisyon ile aynı anda 0 ve 1 durumlarının doğrusal birleşiminde bulunabilir; bu özellik, belirli hesaplamaların paralel yürütülmesini olanaklı kılar. İki kübit arasındaki kuantum dolanıklığı ise aralarında klasik iletişim gerekmeksizin güçlü korelasyonlar oluşturur. Teorik analizler, doğrusal denklem sistemlerinde üstel hızlanma (HHL algoritması) ve yapılandırılmamış aramada karesel hızlanma (Grover algoritması) öngörmektedir. Temel QML yaklaşımları arasında Kuantum Destek Vektör Makineleri (QSVM), Değişimsel Kuantum Devreler (VQC), Kuantum Sinir Ağları (QNN) ve Kuantum Yaklaşık Optimizasyon Algoritması (QAOA) öne çıkmaktadır. VQC'ler parametrik kuantum kapılarıyla oluşturulmuş ve klasik optimizörlerle eğitilen hibrit devrelerdir; NISQ (Noisy Intermediate-Scale Quantum) çağının en gerçekçi yaklaşımı olarak kabul görmektedir. Değişimsel Kuantum Özdeğer Çözücüsü (VQE) ise kimya simülasyonu ve ilaç keşfinde moleküler enerji hesaplamak için kullanılmaktadır. NISQ çağında mevcut kuantum işlemciler yüzlerce fiziksel kübit içermekte; ancak gürültü ve hata oranları yüksek kalmaktadır. Genel amaçlı makine öğrenmesi görevlerinde kanıtlanmış bir kuantum hızlanması henüz pratik ölçekte gösterilememiştir. PennyLane, Qiskit Machine Learning ve TensorFlow Quantum gibi açık kütüphaneler, klasik ML araçlarıyla entegre hibrit iş akışları geliştirmeyi kolaylaştırmakta ve araştırmacıların gerçek kuantum donanımlarında deney yapmasını erişilebilir kılmaktadır. Bu araç ekosistemi, QML'nin teorik potansiyelini pratik uygulamaya taşımanın önündeki en kritik köprü işlevi görmektedir. Kuantum hesaplama, ilaç molekülü tasarımını, kriptografiyi ve finans portföy optimizasyonunu dönüştürme potansiyeli taşımakta; QML bu potansiyelin makine öğrenmesi boyutunu oluşturmaktadır.
State Space Model (Durum Uzayı Modeli)
State Space Model (SSM), kontrol teorisinin köklü matematiksel altyapısından ilham alarak derin öğrenme mimarisine adapte edilmiş, dizi verilerini işlemek için kullanılan güçlü bir yaklaşımdır. Temel fikir zariftir: bir gizli durum vektörü (h), her yeni girdi tokeni işlendiğinde güncellenir ve tüm geçmiş bilgiyi sıkıştırılmış biçimde taşır. Böylece sistem her adımda yalnızca mevcut girdi ile gizli duruma bakar; bu da bellek ve hesaplama açısından büyük bir verimlilik sağlar. Matematiksel olarak klasik bir SSM üç temel denklemle tanımlanır: durum geçiş denklemi h'(t) = Ah(t) + Bx(t), çıkış denklemi y(t) = Ch(t) + Dx(t) ve bu parametreler (A, B, C, D matrisleri) eğitim sürecinde öğrenilir. Sürekli zamandaki bu denklemler, sinir ağlarına entegre edilmek üzere ayrık zamana dönüştürülür; bu adıma "diskritizasyon" denir. SSM'lerin derin öğrenmede yeniden popülerleşmesi 2021 yılında Albert Gu ve ekibinin S4 (Structured State Spaces for Sequences) modeliyle başladı. S4, uzun bağımlılıkları yakalamak için HiPPO matris teorisini kullanarak dikkat mekanizmasına ihtiyaç duymadan çok uzun dizileri işleyebildiğini kanıtladı. Ardından Gu ve Tri Dao'nun 2023'teki Mamba çalışması "seçici durum uzayı" mekanizmasını tanıttı: parametreler artık girdiye bağlı hale geldi; model her token için SSM parametrelerini dinamik olarak uyarladı. Transformer modellerine kıyasla SSM'lerin en kritik avantajı hesaplama karmaşıklığındadır. Transformer'lar dikkat mekanizması nedeniyle O(n²) karmaşıklığa sahipken SSM'ler O(n) doğrusal karmaşıklıkla çalışır; bu da özellikle çok uzun dizilerde belirgin bir hız ve bellek avantajı sağlar. Mamba, sekans uzunluğu 2.000 token'ı geçtiğinde FlashAttention-2'den daha hızlı çalışmakta ve benzer büyüklükteki Transformer'a göre 4-5 kat daha yüksek çıkarım verimi sunmaktadır. Bugün SSM'ler ses işleme, genomik dizi analizi, zaman serisi tahmini ve uzun doküman anlama gibi alanlarda güçlü sonuçlar verirken AI21 Labs'ın Jamba modeli gibi Transformer-SSM hibrit mimariler de hızla gelişmektedir.
Vision Transformer (ViT) (Görüntü Transformer)
Vision Transformer (ViT), 2020 yılında Google Brain ekibi tarafından yayımlanan "An Image is Worth 16x16 Words" makalesiyle tanıtılan ve görüntü işleme alanında Transformer mimarisini merkeze alan çığır açıcı bir derin öğrenme modelidir. CNN'lerin (Evrişimli Sinir Ağları) onlarca yıl boyunca hâkim olduğu bilgisayarlı görü alanında ViT, bu paradigmayı kökten değiştirmiştir. ViT'in temel çalışma ilkesi görüntüyü sabit boyutlu yamalar (patch) dizisine bölmektir. Örneğin 224×224 piksellik bir görüntü, 16×16 boyutunda 196 yamaya ayrılır; her yama düzleştirilerek (flatten) doğrusal bir projeksiyon katmanından geçirilir ve D-boyutlu bir gömme vektörüne dönüştürülür. Sınıflandırma için öğrenilebilir bir [CLS] tokeni eklenir; tüm yamalara pozisyonel kodlama uygulanarak sıralamanın kaybolması önlenir. Bu vektör dizisi standart Transformer encoder bloklarına — çok başlı öz-dikkat ve ileri beslemeli ağ katmanlarına — beslenir. Çıkışta [CLS] tokeninin gömme vektörü bir MLP kafasına verilerek görüntü sınıfı tahmin edilir. CNN'lerden temel farkı, uzamsal tümevarımsal önyargı (inductive bias) taşımamasıdır. CNN yerel evrişimler ve paylaşımlı ağırlıklarla bu önyargıyı yapıya kodlarken ViT tüm bu örüntüleri veriden öğrenir; bu yüzden JFT-300M gibi çok büyük veri kümelerinde ön eğitim gerektirir. DeiT mimarisi öğretmen-öğrenci damıtma ile bu gereksinimi ImageNet ölçeğine indirmiştir. Başlıca varyantlar arasında Swin Transformer (kayan pencereli dikkat ile hiyerarşik özellik haritaları), BEiT ve MAE (maskeli ön eğitim), DINOv2 (öz-süpervizyon) ve SAM/SAM2 (evrensel segmentasyon) sayılabilir. Nesne tespitinde DETR, semantik segmentasyonda SegFormer, görsel-dilsel temel modellerde CLIP ve Flamingo ViT'i omurga olarak kullanmaktadır. ViT'in dikkat ısı haritaları yorumlanabilirliği artırır: hangi yamaların sınıflandırma kararını etkilediği görselleştirilebilir. Tıbbi görüntülemede, uydu görüntüsü analizinde, otonom araç algı sistemlerinde ve çok-kipli (multimodal) büyük modellerde ViT vazgeçilmez bir bileşen haline gelmiştir. 36.000'i aşkın atıf sayısıyla bu makale, bilgisayarlı görünün en etkili çalışmaları arasına girmiştir.
Word Embedding (Kelime Gömme)
Kelime gömme (word embedding), kelimeleri yüksek boyutlu gerçek sayı vektörlerine dönüştüren temsil öğrenme tekniğidir. Bu yaklaşım, kelimelerin anlamsal ve sözdizimsel ilişkilerini matematiksel uzayda yansıtır: anlamca yakın sözcükler uzayda birbirine yakın konumlanırken farklı anlamlılar uzakta kalır. Tipik vektör boyutları 50 ile 4096 arasında değişir; daha yüksek boyut daha fazla anlam nüansı taşır ancak bellek ve hesaplama maliyeti de artar. Klasik bag-of-words yaklaşımı kelimeleri birbirinden bağımsız bir-sıcak (one-hot) vektörlerle temsil ederdi; bu yöntem "kral" ile "hükümdar" arasındaki anlamsal bağı yakalayamıyordu. Word2Vec (2013, Google) ve GloVe (2014, Stanford) mimarileriyle birlikte yoğun vektör temsilleri yaygınlaştı. Word2Vec'in ünlü örneğinde "kral − erkek + kadın ≈ kraliçe" vektör aritmetiği, modelin anlam ilişkilerini öğrendiğini kanıtladı. FastText (Meta, 2016) ise kelimeleri karakter n-gramı parçalarına bölerek sözlük dışı sözcükleri de vektöre çevirme becerisini getirdi. Statik kelime gömmelerinin (Word2Vec, GloVe, FastText) temel sınırlaması bağlam körlüğüdür: "banka" kelimesi finans veya nehir kenarı anlamına geldiğinde aynı vektörü alır. Bu sorunu BERT ve türevi modeller çözdü: Transformer katmanları her kelimeye bağlama özgü bir temsil üretir, böylece aynı kelime farklı cümlelerde farklı vektörler alır. Çok anlamlı kelimeler artık cümle bağlamına göre doğru şekilde kodlanabilir hale gelmiştir. Türkçe için özelleştirilmiş gömmeler mevcuttur: BERTurk, TURK-BERT ve çeşitli FastText modelleri geniş Türkçe corpus'larla eğitilmiştir. Türkçe'nin eklemeli morfolojisi nedeniyle alt-kelime gömmeleri ve karakter tabanlı modeller özellikle önem kazanmaktadır: "gidiyorum", "gidiyorsun", "gidiyoruz" gibi çekimli formlar kök anlamını paylaşacak biçimde kodlanabilir. Günümüzde kelime gömmesi kavramı cümle ve belge gömmelerine (sentence/document embeddings) evrilmiştir. OpenAI text-embedding-3, Cohere Embed ve Mistral Embed gibi modeller tüm paragrafı tek bir vektörle temsil ederek Retrieval-Augmented Generation (RAG) altyapıları, semantik arama motorları ve öneri sistemlerinin omurgasını oluşturur. Gömme kalitesi cosine benzerliği ve kNN kıyaslamaları ile ölçülür; STS (Semantic Textual Similarity) benchmark setleri alanda standart değerlendirme ölçütü olarak kullanılır.