tag NVIDIA
Blackwell (NVIDIA Blackwell GPU Mimarisi)
Bu sayfada NVIDIA (Blackwell (NVIDIA Blackwell GPU Mimarisi)) etiketi ile işaretlenmiş 12 yapay zeka kavramını bulabilirsiniz.
Blackwell, NVIDIA tarafından Mart 2024'te duyurulan beşinci nesil GPU mimarisidir ve yapay zeka altyapısında çığır açan bir ilerlemeyi temsil eder. İsmi, olasılık teorisi ve istatistiğe katkılarıyla tanınan Afrikalı-Amerikalı matematikçi ve akademisyen David Blackwell'den almaktadır. Mimari, TSMC'nin gelişmiş 4NP üretim süreci üzerine inşa edilmiş çift-die (dual-die) chiplet tasarımı kullanır ve toplamda 208 milyar transistör içerir; bu rakam selefinin (Hopper/H100) neredeyse iki katıdır. Blackwell ailesi birden fazla GPU çeşidini kapsar: B100 giriş seviyesi varyant, B200 amiral gemisi GPU ve GB200 Grace-Blackwell Süperçip modülü. Bellek kapasitesi açısından B200, 192 GB HBM3e belleğe ve 8 TB/s bellek bant genişliğine sahiptir. Blackwell Ultra serisiyle birlikte gelen B300 modeli ise bu değeri 288 GB HBM3e'ye çıkarmıştır. GB200 NVL72 raf sistemi, 72 adet B200 GPU ile 36 adet Grace CPU'yu tek bir sıvı soğutmalı rafta birleştirerek toplamda 13,5 TB HBM3e bellek kapasitesi ve 1,4 eksaFLOPS hesaplama gücü sunar. Beşinci nesil NVLink (NVLink 5.0), her GPU için 1,8 TB/s çift yönlü bant genişliği sağlayarak Hopper'daki NVLink 4'e göre bant genişliğini ikiye katlar. Çift-die mimarisinin iç bağlantısında ise 10 TB/s bant genişliği elde edilmektedir; bu sayede iki die arasındaki veri transferi neredeyse engelsiz gerçekleşir. Blackwell'in en dikkat çekici yeniliği FP4 ve FP6 hassasiyet formatları ile mikro-tensör ölçeklendirme teknolojisidir. FP4 formatında 20 petaFLOPS hesaplama gücü sunan mimari, model ağırlıklarının bellek gereksinimini yarıya indirerek trilyon parametreli modellerin eğitimini ve çıkarımını daha önce mümkün olmayan ölçeklerde gerçekleştirmeye olanak tanır. Performans karşılaştırmalarında Blackwell, Hopper (H100) mimarisine göre çarpıcı üstünlükler sergiler: Llama 2 70B ince ayarında 2,2 kat, GPT-3 175B ön eğitiminde ise 2 kat hız artışı sağlar. GB200 NVL72 raf sistemi, büyük ölçekli LLM çıkarım görevlerinde H100'e kıyasla 30 kat performans iyileştirmesi sunarken enerji tüketimini 25 kat azaltır. Önceden 256 Hopper GPU gerektiren iş yükleri artık yalnızca 64 Blackwell GPU ile yürütülebilmektedir. Google, Meta, Microsoft ve Amazon gibi hiper ölçekli şirketler büyük yapay zeka modellerinin eğitimi ve çıkarım altyapısı için Blackwell'i benimsemiştir. NVIDIA bu teknolojiyi yapay zeka fabrikaları olarak konumlandırmakta ve trilyon parametreli modellerin ticari ölçekte çalışmasını mümkün kılan hesaplama altyapısı olarak tanımlamaktadır.
Blackwell (NVIDIA Blackwell GPU Mimarisi)
Blackwell, NVIDIA tarafından Mart 2024'te duyurulan beşinci nesil GPU mimarisidir ve yapay zeka altyapısında çığır açan bir ilerlemeyi temsil eder. İsmi, olasılık teorisi ve istatistiğe katkılarıyla tanınan Afrikalı-Amerikalı matematikçi ve akademisyen David Blackwell'den almaktadır. Mimari, TSMC'nin gelişmiş 4NP üretim süreci üzerine inşa edilmiş çift-die (dual-die) chiplet tasarımı kullanır ve toplamda 208 milyar transistör içerir; bu rakam selefinin (Hopper/H100) neredeyse iki katıdır. Blackwell ailesi birden fazla GPU çeşidini kapsar: B100 giriş seviyesi varyant, B200 amiral gemisi GPU ve GB200 Grace-Blackwell Süperçip modülü. Bellek kapasitesi açısından B200, 192 GB HBM3e belleğe ve 8 TB/s bellek bant genişliğine sahiptir. Blackwell Ultra serisiyle birlikte gelen B300 modeli ise bu değeri 288 GB HBM3e'ye çıkarmıştır. GB200 NVL72 raf sistemi, 72 adet B200 GPU ile 36 adet Grace CPU'yu tek bir sıvı soğutmalı rafta birleştirerek toplamda 13,5 TB HBM3e bellek kapasitesi ve 1,4 eksaFLOPS hesaplama gücü sunar. Beşinci nesil NVLink (NVLink 5.0), her GPU için 1,8 TB/s çift yönlü bant genişliği sağlayarak Hopper'daki NVLink 4'e göre bant genişliğini ikiye katlar. Çift-die mimarisinin iç bağlantısında ise 10 TB/s bant genişliği elde edilmektedir; bu sayede iki die arasındaki veri transferi neredeyse engelsiz gerçekleşir. Blackwell'in en dikkat çekici yeniliği FP4 ve FP6 hassasiyet formatları ile mikro-tensör ölçeklendirme teknolojisidir. FP4 formatında 20 petaFLOPS hesaplama gücü sunan mimari, model ağırlıklarının bellek gereksinimini yarıya indirerek trilyon parametreli modellerin eğitimini ve çıkarımını daha önce mümkün olmayan ölçeklerde gerçekleştirmeye olanak tanır. Performans karşılaştırmalarında Blackwell, Hopper (H100) mimarisine göre çarpıcı üstünlükler sergiler: Llama 2 70B ince ayarında 2,2 kat, GPT-3 175B ön eğitiminde ise 2 kat hız artışı sağlar. GB200 NVL72 raf sistemi, büyük ölçekli LLM çıkarım görevlerinde H100'e kıyasla 30 kat performans iyileştirmesi sunarken enerji tüketimini 25 kat azaltır. Önceden 256 Hopper GPU gerektiren iş yükleri artık yalnızca 64 Blackwell GPU ile yürütülebilmektedir. Google, Meta, Microsoft ve Amazon gibi hiper ölçekli şirketler büyük yapay zeka modellerinin eğitimi ve çıkarım altyapısı için Blackwell'i benimsemiştir. NVIDIA bu teknolojiyi yapay zeka fabrikaları olarak konumlandırmakta ve trilyon parametreli modellerin ticari ölçekte çalışmasını mümkün kılan hesaplama altyapısı olarak tanımlamaktadır.
CUDA (Compute Unified Device Architecture)
CUDA (Compute Unified Device Architecture), NVIDIA tarafından 2006 yılında geliştirilen ve GPU'ları genel amaçlı hesaplama (GPGPU) için kullanmayı mümkün kılan paralel hesaplama platformu ve programlama modelidir. Grafik işleme birimlerinin binlerce çekirdeğini eş zamanlı olarak çalıştırma kapasitesini yapay zeka ve bilimsel hesaplamalar için açan bu teknoloji, modern derin öğrenmenin temel altyapısını oluşturur. CUDA, geleneksel CPU programlamadan temel bir paradigma değişikliği sunar. CPU'lar güçlü ancak sınırlı sayıda çekirdekle sıralı işlemler için optimize edilmişken; NVIDIA GPU'ları onlarca binden yüz binlerce CUDA çekirdeğiyle aynı anda binlerce işlem gerçekleştirebilir. Bu eşzamanlılık, matris çarpımı, konvolüsyon ve gradyan hesaplama gibi derin öğrenme operasyonlarını CPU'ya kıyasla 10–100 kat hızlandırır. CUDA'nın iş parçacığı hiyerarşisi üç katmandan oluşur: Temel birim olan iş parçacıkları (threads), bu iş parçacıklarını gruplandıran bloklar (blocks) ve blokları organize eden ızgaralar (grids). Bir CUDA çekirdeği (kernel) çağrıldığında GPU'da binlerce iş parçacığı eş zamanlı olarak çalışır; her blok içindeki iş parçacıkları paylaşılan belleği (shared memory) kullanarak birbirleriyle iletişim kurabilir. CUDA'nın bellek hiyerarşisi de performans açısından kritik rol oynar. Global bellek geniş kapasiteli (~80 GB/s bant genişliği) ancak yüksek gecikmeli; paylaşılan bellek ise blok başına ~100 KB kapasitesiyle SRAM hızında (~8 TB/s) çalışır. Verimli CUDA kodu, veri hareketini minimize ederek paylaşılan belleği akıllıca kullanır. Kaydediciler (registers), sabit bellek (constant memory) ve doku belleği (texture memory) ise erişim desenlerine göre optimize edilmiş ek bellek katmanları sunar. CUDA Toolkit, geliştiricilere nvcc derleyicisi, cuBLAS (lineer cebir), cuDNN (derin sinir ağları), cuFFT (Fourier dönüşümü) ve NCCL (çoklu GPU iletişimi) gibi optimize kütüphaneler sunar. Günümüzde FlashAttention ve TensorRT-LLM gibi araçlar CUDA kernellerini büyük dil modellerinin çıkarım aşaması için özelleştirerek LLM hızını 2–4 kat artırmaktadır. NVIDIA H100 gibi gelişmiş veri merkezi GPU'ları 16.896 CUDA çekirdeğine ek olarak FP16/BF16/INT8 matris işlemlerini 4–16 kat hızlandıran Tensor Core'lar içerir.
DPU (Veri İşleme Birimi)
DPU (Data Processing Unit — Veri İşleme Birimi), CPU ve GPU'nun yanında modern bilişimin üçüncü işlemci sütunu olarak konumlanan, ağ, depolama ve güvenlik altyapısını donanım düzeyinde yönetmek için tasarlanmış özel bir işlemci birimidir. NVIDIA, 2020 yılında BlueField-2 ile bu kavramı veri merkezi sektörüne kazandırdı; teknolojinin temeli ise daha önce SmartNIC ve altyapı yük boşaltma (infrastructure offload) işlemcileri olarak bilinen çözümlere dayanır. Geleneksel veri merkezlerinde ağ trafiği yönetimi, şifreleme, depolama sanallaştırma ve güvenlik duvarı gibi altyapı görevleri CPU çekirdeklerinin önemli bir bölümünü tüketir. DPU, bu görevleri altyapı bant hızında (line rate) gerçekleştiren donanım hızlandırıcılar aracılığıyla üstlenir ve CPU'nun tüm kapasitesini uygulama mantığı ile yapay zeka hesaplamaya yönlendirir. Yapay zeka kümelerinde DPU'nun rolü özellikle kritiktir. Yüzlerce veya binlerce GPU'dan oluşan ölçekli eğitim kümelerinde GPU'lar sürekli olarak gradyan senkronizasyonu, model parametresi aktarımı ve kontrol noktası (checkpoint) G/Ç işlemleri için ağı kullanır. Bu trafik, geleneksel mimaride host CPU'nun omuzlarına yüklenir; küme büyüdükçe CPU darboğazı GPU kullanım verimliliğini düşürür. DPU, RDMA ve RoCE (RDMA over Converged Ethernet) işlemlerini doğrudan kendi üzerindeki donanım motorlarında çalıştırarak bu yükü host sistemden tamamen kaldırır. NVIDIA BlueField-3, günümüzün en yaygın DPU'su olarak öne çıkar. TSMC 5 nm sürecinde üretilen BlueField-3, 22 milyar transistör barındırır, 400 Gb/sn ağ çıkışı sunar ve Arm Cortex-A78 çekirdekleri üzerinde bağımsız bir Linux işletim sistemi çalıştırır. NVIDIA'nın açıkladığına göre tek bir BlueField-3, yaklaşık 300 CPU çekirdeğinin üstlenebileceği altyapı yükünü karşılayabilmektedir. Marvell OCTEON 10 ve Intel IPU (Infrastructure Processing Unit) bu alandaki başlıca rakip çözümler arasında yer alır. Güvenlik perspektifinden DPU, host işletim sisteminden bağımsız ayrı bir koruma alanı oluşturur. Kiracı iş yükleri, DPU üzerinde çalışan ağ izleme, şifreleme veya güvenlik duvarı kurallarına müdahale edemez; bu özellik çok kiracılı bulut altyapılarında sıfır güven (zero-trust) mimarisinin donanım temelini sağlar. Enerji verimliliği boyutunda genel amaçlı bir CPU'nun altyapı görevleri için harcadığı enerji ile amaca özel DPU donanımının harcadığı enerji arasındaki fark büyüktür. Veri merkezleri fiziksel güç yoğunluk sınırlarına yaklaştıkça DPU, toplam sistem verimliliğine orantısız biçimde olumlu katkı sağlar.
GPU (Graphics Processing Unit) (Grafik İşlemci (Ekran Kartı))
GPU (Graphics Processing Unit — Grafik İşleme Birimi), başlangıçta bilgisayar grafiklerini hesaplamak için tasarlanmış; fakat binlerce küçük çekirdekli paralel mimarisi ile yapay zeka ve yüksek performanslı hesaplama (HPC) alanında vazgeçilmez hale gelmiş bir işlemci türüdür. Günümüzde derin öğrenme eğitimi ve çıkarsama işlemlerinin büyük çoğunluğu GPU üzerinde gerçekleşmektedir. GPU'ların paralel mimarisi, AI hesaplamalarında kritik öneme sahip matris çarpma ve tensor işlemlerine çok iyi uymaktadır. NVIDIA'nın CUDA (Compute Unified Device Architecture) platformu, geliştiricilere GPU üzerinde genel amaçlı hesaplama yapmayı mümkün kılan ilk geniş kapsamlı yazılım katmanıydı. 2007'de tanıtılan CUDA, bugün de derin öğrenme ekosisteminin temelini oluşturmaktadır. NVIDIA'nın AI odaklı GPU'ları GPU mimarisinin evrimini yönlendirmiştir: Tesla (2008), Kepler, Maxwell, Pascal, Volta, Ampere ve son olarak Hopper mimarisi (H100). A100 ve H100, LLM eğitiminde standart haline gelmiştir. AMD ise ROCm platformu ve MI300X çipleriyle bu pazara rakip olarak girmektedir. Apple'ın M serisi çipler ise birleşik bellek mimarisiyle AI çıkarsama için enerji verimli alternatif sunmaktadır. Derin öğrenme çerçeveleri (TensorFlow, PyTorch) GPU desteğini neredeyse tamamen CUDA/cuDNN (NVIDIA) üzerinden sağlar. Tensor Core'lar, H100 gibi modern çipler üzerinde yarı hassas (FP16/BF16) matris işlemlerini 10-100 kat hızlandırır. GPU belleği (VRAM) model büyüklüğünü doğrudan sınırlar; 80GB VRAM'e sahip H100, 70 milyar parametreli bir modeli tam hassasiyetle tutabilir. Bulut GPU hizmetleri (AWS EC2 P4d, Google Cloud A100, Azure NDv4) on-premises donanım yatırımı yapmadan büyük ölçekli model eğitimi olanağı tanır. Multi-GPU konfigürasyonlarında NVLink ve InfiniBand bant genişliği, eğitim süresini doğrusal ölçekte kısaltmaktadır. GPU kapasitesi, modern yapay zeka sistemlerinin ölçeğini doğrudan belirleyen temel mühendislik kısıtlarından biri olmaya devam etmektedir. Enerji tüketimi ve soğutma maliyetleri de GPU seçimini etkileyen önemli faktörler arasındadır; H100 çipinin maksimum güç tüketimi 700W düzeyindedir.
Hopper Architecture (Hopper Mimarisi)
Hopper Mimarisi, NVIDIA tarafından Mart 2022'de GTC (GPU Technology Conference) etkinliğinde tanıtılan ve büyük ölçekli yapay zeka modelleri ile yüksek performanslı hesaplama (HPC) iş yükleri için tasarlanmış yedinci nesil GPU mikro-mimarisidir. Bilgisayar biliminin öncüsü, ilk derleyici kavramının geliştiricisi ve COBOL standartlaşmasının mimarlarından biri olan Grace Hopper'ın anısına adlandırılan bu mimari, önceki nesil Ampere mimarisini (A100) veri merkezi segmentinde devralmıştır. Mimarinin en önemli yeniliği Transformer Engine adı verilen özel hesaplama birimidir. Bu birim, derin öğrenme modellerinin eğitimi sırasında FP8 ve FP16 sayısal hassasiyetleri arasında her işlem için otomatik ve dinamik geçiş yaparak hem hesaplama hızını hem de enerji verimliliğini önemli ölçüde artırır. FP8 hassasiyetindeki yeni Tensor Core'lar E4M3 (4 üs, 3 mantis biti) ve E5M2 (5 üs, 2 mantis biti) olmak üzere iki veri türünü destekler; bu sayede büyük dil modellerinin eğitim süresi, A100'e kıyasla FP8 düzeyinde 6 kata kadar kısaltılabilmektedir. Hopper GPU'ları TSMC 4N (4nm sınıfı) üretim süreciyle üretilmekte olup 80 milyar transistör içermektedir. HBM3 bellek teknolojisiyle 3 TB/s'ye ulaşan bellek bant genişliği, büyük model matrislerinin GPU'ya aktarımında darboğaz oluşmasını engeller. Dördüncü nesil NVLink bağlantısı (NVLink 4.0) ise çoklu GPU kümelerinde GPU'lar arası veri aktarım hızını önceki nesle göre iki katına çıkararak model paralelliğini kolaylaştırır. Multi-Instance GPU (MIG) teknolojisiyle tek bir H100 GPU'su, birbirinden yalıtılmış en fazla 7 bağımsız GPU örneğine bölünebilir. Bu özellik bulut servis sağlayıcıları için kaynak paylaşımı ve maliyet optimizasyonu açısından kritik önem taşır. Ek olarak Confidential Computing desteği, farklı kiracılara ait iş yüklerinin donanım düzeyinde şifrelenerek birbirinden korunmasına olanak tanır. PCIe Gen5 desteği de CPU ile GPU arasındaki veri transferini hızlandırmaktadır. Hopper mimarisinin veri merkezindeki öne çıkan ürünleri H100 ve H200 GPU'larıdır. Bu GPU'lar, GPT-4, LLaMA, Gemini ve benzeri büyük dil modellerinin eğitiminde dünya genelindeki veri merkezlerinde yaygın biçimde kullanılmaktadır. Hopper'ın ardından NVIDIA, 2024 yılında Blackwell mimarisini (B100, B200) duyurmuştur.
NVIDIA H100 (NVIDIA H100)
NVIDIA H100, 2022 yılında duyurulan ve Hopper mikromimarisi (GH100 die) üzerine inşa edilen yüksek performanslı veri merkezi GPU'sudur. GPT-4, Llama ve diğer büyük dil modelleri dahil pek çok öncü yapay zeka modelinin eğitiminde kullanılan H100, bu alanda endüstri standardı konumuna gelmiştir. H100'ün en dikkat çekici yeniliği Transformer Engine'dir. Bu bileşen, FP8 ile FP16/BF16 hassasiyeti arasında katman bazında otomatik geçiş yaparak hem hesaplama hızını hem de model doğruluğunu korur. FP8 modunda seyrek (sparse) matris çarpımında 4 petaFLOPS, FP16'da ise 2 petaFLOPS zirve kapasitesine ulaşır. Bellek cephesinde, 80 GB HBM3 ve 3,35 TB/sn bant genişliğiyle büyük model ağırlıklarını verimli şekilde barındırır. NVLink 4.0 ile çip başına 900 GB/sn çift yönlü bant genişliği sağlanır; NVSwitch aracılığıyla 16 H100'ün sorunsuzca birbirine bağlanmasına olanak tanır. Bu ölçeklendirme kabiliyeti, yüzlerce milyar parametreli modellerin eğitimini pratik hale getirir. H100, SXM5 (sunucu kartı, 700 W) ve PCIe (350 W) olmak üzere iki formda sunulur. AWS, Microsoft Azure ve Google Cloud gibi büyük bulut sağlayıcıları H100 tabanlı sanal makine örnekleri sunar; piyasa fiyatı birim başına 25.000–40.000 ABD doları aralığındadır. Ardından gelen H200 modeli 141 GB HBM3e bellekle geliştirilmiş; Blackwell mimarisindeki B100 ve B200 serileri ise performans çıtasını daha da yükseltmiştir. H100'ün programlama modeli, CUDA ekosistemi ve cuDNN, cuBLAS gibi kütüphaneler üzerine kuruludur; PyTorch ve JAX çerçeveleri bu optimizasyonları otomatik kullanır. Güvenli Çok Kiracılı Ortam (MIG — Multi-Instance GPU) özelliği, tek bir H100'ü yedi izole bölüme ayırarak bulut sağlayıcılarının kaynakları daha verimli paylaştırmasına olanak tanır. TensorRT ve Triton Inference Server ile birleştiğinde H100, eğitim kadar çıkarım (inference) iş yükleri için de endüstri referans noktasıdır.
NVIDIA NIM (NVIDIA NIM)
NVIDIA NIM (NVIDIA Inference Microservices), yapay zeka modellerini kurumsal ortamlarda hızlı, güvenli ve ölçeklenebilir biçimde devreye almak için tasarlanmış konteyner tabanlı bir mikroservis paketidir. Mart 2024'teki GTC konferansında duyurulan ve Nisan 2024'te NVIDIA AI Enterprise 5.0 kapsamında genel kullanıma açılan NIM, her biri bir Docker konteyneri olarak paketlenmiş hazır model servislerinden oluşur. Her NIM konteyneri; model ağırlıkları, otomatik olarak seçilen çıkarım arka ucu (TensorRT-LLM, vLLM veya SGLang) ve OpenAI API uyumlu bir REST API uç noktasından oluşur. Bu sayede geliştiriciler, mevcut OpenAI tabanlı uygulamalarını minimum kod değişikliğiyle kendi GPU altyapısına taşıyabilir. Çıkarım arka ucu, hedef GPU'ya ve model türüne göre otomatik seçilir; FP8, INT4 ve GGUF gibi nicemleme (quantization) formatları desteklenerek bellek kullanımı optimize edilir. NIM, NVIDIA'nın NGC (GPU Cloud) kataloğu üzerinden yüzlerce model sunar: Meta Llama 3.x ailesi (8B, 70B, 405B), Mistral, Google Gemma, Stable Diffusion, Whisper ve NVIDIA Cosmos video modelleri bu katalogda yer alır. Dağıtım ortamı esnekliği açısından NIM; yerel sunucularda, veri merkezlerinde ve Amazon AWS, Microsoft Azure ile Google Cloud gibi büyük bulut sağlayıcılarında çalışabilir. Kurumsal kullanım için NIM konteynerleri kriptografik olarak imzalanmış, CVE açık taramasından geçirilmiş ve SBOM (Yazılım Malzeme Listesi) belgesiyle birlikte yayımlanmıştır. Hava boşluklu (air-gapped) ortamlar da desteklenmektedir. KVKK gibi yerel düzenleyici gereksinimleri olan Türk kurumları için NIM, bulut bağımlılığını ortadan kaldırarak tam veri egemenliği sağlayan bir çözüm sunar. Kubernetes yerel ölçeklendirme desteği sayesinde NIM, düşük gecikme ve yüksek verim gerektiren üretim ortamları için idealdir; RAG pipeline'ları, ajan sistemleri ve gerçek zamanlı çıkarım uygulamalarında yaygın olarak kullanılmaktadır. NVIDIA'nın kendi kıyaslama ölçümlerine göre NIM, optimize edilmiş TensorRT-LLM arka ucuyla standart dağıtımlara kıyasla 3-5 kat daha yüksek token verimi sunabilmekte; bu avantaj özellikle yoğun üretim trafiğinde belirginleşmektedir.
NVLink (GPU Ara Bağlantısı)
NVLink, NVIDIA'nın GPU'lar arasında doğrudan, yüksek bant genişlikli ve düşük gecikmeli veri aktarımı kuran özel ara bağlantı teknolojisidir. Geleneksel PCIe veri yolunda GPU'lar birbirleriyle CPU üzerinden haberleşmek zorundadır; NVLink bu dolambaçlı yolu ortadan kaldırır ve bir GPU'nun diğerinin belleğine doğrudan erişmesine izin verir. Büyük dil modellerinin eğitiminde onlarca, hatta yüz binlerce GPU'nun aynı anda çalıştığı 2026 ortamında bu doğrudan bağlantı, çok-GPU sistemlerinin temel yapı taşı hâline geldi. Teknoloji 2016'da Pascal mimarili P100 GPU ile 160 GB/s toplam bant genişliğiyle tanıtıldı. Volta (V100) ile 300 GB/s'ye, Ampere (A100) ile 600 GB/s'ye, Hopper (H100/H200) ile 900 GB/s'ye çıkan değer, Blackwell (B200/GB200) mimarisindeki NVLink 5.0'da GPU başına 1,8 TB/s'ye ulaştı. Karşılaştırmak gerekirse PCIe 5.0 x16 yaklaşık 128 GB/s taşır; NVLink 5.0 bunun yaklaşık 14 katıdır. NVIDIA'nın yol haritasında 2026 sonunda gelmesi beklenen Vera Rubin platformuyla NVLink 6.0'ın bant genişliği GPU başına 3,6 TB/s'ye çıkacak. İkiden fazla GPU'yu birleştirmek için NVIDIA, NVSwitch anahtar yongasını geliştirdi. NVSwitch, tüm GPU'ları all-to-all (herkesten herkese) topolojide eşit bant genişliğiyle bağlar. Bu mimarinin en çarpıcı örneği GB200 NVL72 rafıdır: 72 Blackwell GPU tek bir NVLink alanında birleşir ve toplam 130 TB/s NVLink bant genişliğiyle tek bir dev GPU gibi programlanır. Mayıs 2025'te duyurulan NVLink Fusion programı, teknolojiyi ilk kez üçüncü taraflara açtı: MediaTek, Marvell, Fujitsu ve Qualcomm gibi firmalar kendi CPU ve özel yongalarını NVIDIA GPU'larına NVLink ile bağlayabiliyor. Buna karşılık AMD, Intel, Google ve Microsoft'un başını çektiği UALink konsorsiyumu, NVLink'e açık standart bir alternatif geliştirmeye çalışıyor. GPT-4 sonrası devasa modellerin eğitiminde gradyan senkronizasyonu ve tensor paralelliği trafiği PCIe kapasitesini kolayca aştığından, NVLink bugün yapay zeka altyapısındaki en kritik rekabet alanlarından biridir.
Tensor Core (Tensor Çekirdeği)
Tensor Core, NVIDIA'nın 2017'de Volta mimarisiyle (V100) tanıttığı, matris çarpma-biriktirme (Matrix Multiply-Accumulate, MMA: D = A × B + C) işlemini tek saat döngüsünde gerçekleştiren özel donanım birimidir. Derin öğrenme modellerinin hem eğitimi hem çıkarımı dev matris çarpmalarından oluştuğu için bu birimler, modern yapay zekâ hesaplamasının fiili motoru konumundadır. Klasik CUDA çekirdekleri genel amaçlı skaler ve vektör işlemler için tasarlanmıştır; Tensor Core ise sabit işlevli bir matris motorudur. Bir warp (32 iş parçacığı), `wmma` API'si üzerinden 16×16 matrisleri 4×4 bloklara bölerek işler ve aynı hassasiyetteki FP32 CUDA hesabına kıyasla teorik tepe verimini kata katlar: FP16 modunda yaklaşık 8×, düşük bitli formatlarda çok daha fazlası. En kritik yetenek karma hassasiyettir (mixed precision): çarpma FP16, BF16 veya FP8 gibi kısa formatlarda yapılırken biriktirme FP32'de tutulur. Böylece bellek bant genişliği ihtiyacı yarıya iner, model doğruluğu büyük ölçüde korunur. PyTorch'ta `torch.autocast`, TensorFlow'da `tf.keras.mixed_precision` bu donanımı şeffaf biçimde devreye alır; cuBLAS, cuDNN ve TensorRT kütüphaneleri de arka planda Tensor Core kullanır. Nesil gelişimi hızlıdır: Volta FP16 ile başladı, Turing (2018) INT8/INT4 ekledi, Ampere (A100, 2020) TF32, BF16 ve 2:4 yapısal seyreklik getirdi, Hopper (H100, 2022) FP8 ve Transformer Engine ile LLM eğitiminin standardı oldu. Blackwell (B200/GB200, 2024) 5. nesil Tensor Core'larda FP4 ve FP6 formatlarını, 2. nesil Transformer Engine'i ve mikro ölçekleme (MX) veri tiplerini tanıttı; B200 tek başına FP4'te 9 PFLOPS'u aşan yoğun matris verimi sunar. 2026 itibarıyla GPT, Claude, Gemini ve Llama sınıfı modellerin eğitimi on binlerce Blackwell GPU'luk kümelerde, çıkarımı ise FP8/FP4 nicemlemeyle Tensor Core'lar üzerinde koşar; NVIDIA'nın Rubin mimarisi de 2026 yol haritasında aynı çizgiyi sürdürür.
VRAM (GPU Belleği)
VRAM (Video RAM), GPU'nun (grafik işlemci birimi) üzerinde bulunan ve model ağırlıkları, aktivasyonlar ile ara hesaplama verilerini tutan yüksek bant genişlikli bellektir. Sistem RAM'i CPU'ya hizmet ederken VRAM doğrudan GPU çekirdeklerine bağlıdır ve GDDR7 ile 1 TB/s'nin üzerinde, HBM3e ile 8 TB/s'ye varan veri aktarım hızına ulaşır. Bu hız farkı, binlerce çekirdeğin aynı anda veri beklediği paralel hesaplamada belirleyicidir. Yapay zeka tarafında VRAM, çalıştırılabilecek modelin üst sınırını çizen ana donanım kısıtıdır. Bir büyük dil modelinin (LLM) tüm ağırlıkları çıkarım sırasında VRAM'e yüklenir: 7B parametreli bir model FP16 hassasiyetle yaklaşık 14 GB, 4-bit kuantizasyonla 4-5 GB yer kaplar; 70B sınıfı bir model ise FP16'da 140 GB isteyip INT4 ile 35-40 GB'a iner. Ağırlıkların üzerine, bağlam uzunluğuyla büyüyen KV cache ve batch verisi eklenir; 128K token bağlam tek başına gigabaytlarca ek VRAM tüketebilir. Kapasite aşıldığında model ya hiç yüklenmez ya da sistem RAM'ine taşarak (CPU offload) on kata varan yavaşlamayla çalışır. 2026 itibarıyla kapasite yelpazesi geniştir: tüketici tarafında RTX 5090 32 GB GDDR7, RTX 4090 24 GB sunar; veri merkezinde H100 80 GB, H200 141 GB, Blackwell B200 ise 192 GB HBM3e taşır. Apple Silicon farklı bir yol izler: M3 Ultra'da 512 GB'a çıkan birleşik bellek (unified memory), CPU ve GPU tarafından ortak kullanılır ve ayrı VRAM kavramını ortadan kaldırır. Eğitim senaryolarında VRAM ihtiyacı çıkarımın çok üzerine çıkar; geri yayılım aktivasyonları ve Adam optimizer durum tensörleri parametrelerin 3-4 katı ek bellek tüketir. LoRA ve QLoRA gibi parametre verimli ince ayar yöntemleri bu kısıtlamayı önemli ölçüde hafifletir. Gradyan kontrol noktası alma (gradient checkpointing) tekniği ise bellek-hesaplama takasıyla daha büyük batch boyutlarına izin verir. Yerel LLM çalıştırma, Stable Diffusion/Flux ile görüntü üretme veya LoRA ince ayarı planlayan herkes için ilk sorulacak soru işlemci hızı değil, kaç GB VRAM olduğudur. Model seçiminden donanım alımına kadar her kararda VRAM kapasitesi belirleyici etkendir.
H200 (NVIDIA H200 GPU)
H200, NVIDIA'nın veri merkezi GPU ailesinde Hopper mimarisinin en üst modeli olarak 2023 yılında duyurulmuş ve 2024 yılında kullanıma sunulmuş bir yapay zeka hızlandırıcısıdır. H100'ün doğrudan halefi olan H200'ün en çarpıcı özelliği, öncülünün 80 GB HBM3 belleğinin neredeyse iki katına ulaşan 141 GB HBM3e bellek kapasitesidir. Bu artış, bellek bant genişliğini 3,35 TB/s'den 4,8 TB/s'ye çıkararak büyük dil modellerinin (LLM) çıkarım (inference) süreçlerinde önemli bir hız avantajı sağlar. Yüksek bellek kapasitesi sayesinde LLaMA-3 70B, Falcon-180B veya benzeri büyük modeller tek bir GPU üzerinde tamamen barındırılabilir; bu durum model parçalama (tensor/pipeline parallelism) ihtiyacını azaltır ve istek başına gecikmeyi düşürür. H200, Amazon Web Services (p5e.48xlarge), Microsoft Azure (ND H200 v5 Series) ve Google Cloud gibi başlıca bulut sağlayıcıları aracılığıyla kiralık olarak sunulmaktadır. NVIDIA'nın GH200 Grace Hopper Süper Çip yapılandırmasında H200 GPU, NVIDIA Grace ARM işlemciyle 900 GB/s bant genişliğine sahip NVLink-C2C bağlantısıyla entegre edilmekte; bu da CPU-GPU veri aktarım darboğazını ortadan kaldırmaktadır. H200, eğitim görevlerinde H100 ile benzer hesaplama kapasitesini korurken, bellek yoğun LLM çıkarımında üç kata kadar daha yüksek verim sağlar. Yeni nesil Blackwell mimarisine (B100, B200) geçiş yapılana dek H200, yüksek performanslı yapay zeka altyapısının standardı olmayı sürdürmektedir.
Triton Inference Server (Triton Çıkarım Sunucusu)
Triton Inference Server, NVIDIA tarafından 2018 yılında açık kaynak olarak yayımlanan, üretim ortamlarında yapay zeka modellerini yüksek verimlilikle sunan bir çıkarım sunucusudur. Mart 2025'te NVIDIA Dynamo platformuyla birleştirilerek NVIDIA Dynamo-Triton adını alan bu proje, PyTorch, TensorRT, ONNX Runtime, TensorFlow, OpenVINO ve vLLM gibi popüler çerçevelerden gelen modelleri tek bir süreç içinde barındırır. Temel mimarisinde Triton, her arka uç (backend) için ayrı çalışma ortamları oluşturur ve gelen istekleri paralel olarak yönlendirir. Dinamik yığınlama (dynamic batching), birden fazla isteği tek geçişte birleştirerek GPU kullanımını artırır. Ensemble Pipeline özelliği ise önişleme, model çıkarımı ve sonişleme adımlarını tek bir uçtan uca akış olarak tanımlamayı mümkün kılar. Bu yapı, karmaşık AI boru hatlarının tek bir konfigürasyon dosyasıyla yönetilmesini kolaylaştırır. Desteklediği donanım açısından Triton; NVIDIA GPU, x86 ve ARM tabanlı CPU ile AWS Inferentia üzerinde çalışabilir. Bulut, veri merkezi ve uç bilişim (edge) ortamlarına aynı yapılandırmayla dağıtım yapılabilmesi, yönetim maliyetlerini önemli ölçüde düşürür. MLOps entegrasyonu açısından Kubernetes ile ölçeklendirme, Prometheus ile izleme ve MLflow ile model kayıt akışlarına kolayca entegre edilebilir. Model Registry'den yeni sürüm yüklendiğinde Triton, hizmet kesilmesi olmadan güncelleme yapabilir. Büyük dil modellerini sunarken vLLM backend'i etkinleştirilebilir; bu bileşen sayfa dikkatini (paged attention) ve KV-cache yönetimini Triton çatısı altında gerçekleştirir. Aynı sunucuda LLM, görüntü enkoderi ve ses sınıflandırıcı gibi birden fazla model türünü paralel çalıştırmak gerektiğinde Triton vazgeçilmez bir araç hâline gelir. 2025-2026 itibarıyla Google Vertex AI, AWS SageMaker ve Azure ML gibi büyük bulut platformları Triton'ı birincil çıkarım motoru olarak benimsemiştir. Aralık 2025 sürümüyle vLLM backend'in ağırlık paylaşımı ve speculative decoding desteği de önemli ölçüde güçlendirildi. BSD-3 lisansıyla dağıtılan Triton, kurumsal ML ekiplerinin üretim ortamında güvenle tercih ettiği açık kaynak bir çözüm olmayı sürdürmektedir.