Blackwell (NVIDIA Blackwell GPU Mimarisi)

NVIDIA nın Mart 2024 te duyurduğu beşinci nesil GPU mimarisi; 208 milyar transistör, 192 GB HBM3e ve FP4 desteğiyle trilyon parametreli yapay zeka modellerinin eğitimi ve çıkarımı için tasarlandı.

Blackwell, NVIDIA tarafından Mart 2024'te duyurulan beşinci nesil GPU mimarisidir ve yapay zeka altyapısında çığır açan bir ilerlemeyi temsil eder. İsmi, olasılık teorisi ve istatistiğe katkılarıyla tanınan Afrikalı-Amerikalı matematikçi ve akademisyen David Blackwell'den almaktadır. Mimari, TSMC'nin gelişmiş 4NP üretim süreci üzerine inşa edilmiş çift-die (dual-die) chiplet tasarımı kullanır ve toplamda 208 milyar transistör içerir; bu rakam selefinin (Hopper/H100) neredeyse iki katıdır. Blackwell ailesi birden fazla GPU çeşidini kapsar: B100 giriş seviyesi varyant, B200 amiral gemisi GPU ve GB200 Grace-Blackwell Süperçip modülü. Bellek kapasitesi açısından B200, 192 GB HBM3e belleğe ve 8 TB/s bellek bant genişliğine sahiptir. Blackwell Ultra serisiyle birlikte gelen B300 modeli ise bu değeri 288 GB HBM3e'ye çıkarmıştır. GB200 NVL72 raf sistemi, 72 adet B200 GPU ile 36 adet Grace CPU'yu tek bir sıvı soğutmalı rafta birleştirerek toplamda 13,5 TB HBM3e bellek kapasitesi ve 1,4 eksaFLOPS hesaplama gücü sunar. Beşinci nesil NVLink (NVLink 5.0), her GPU için 1,8 TB/s çift yönlü bant genişliği sağlayarak Hopper'daki NVLink 4'e göre bant genişliğini ikiye katlar. Çift-die mimarisinin iç bağlantısında ise 10 TB/s bant genişliği elde edilmektedir; bu sayede iki die arasındaki veri transferi neredeyse engelsiz gerçekleşir. Blackwell'in en dikkat çekici yeniliği FP4 ve FP6 hassasiyet formatları ile mikro-tensör ölçeklendirme teknolojisidir. FP4 formatında 20 petaFLOPS hesaplama gücü sunan mimari, model ağırlıklarının bellek gereksinimini yarıya indirerek trilyon parametreli modellerin eğitimini ve çıkarımını daha önce mümkün olmayan ölçeklerde gerçekleştirmeye olanak tanır. Performans karşılaştırmalarında Blackwell, Hopper (H100) mimarisine göre çarpıcı üstünlükler sergiler: Llama 2 70B ince ayarında 2,2 kat, GPT-3 175B ön eğitiminde ise 2 kat hız artışı sağlar. GB200 NVL72 raf sistemi, büyük ölçekli LLM çıkarım görevlerinde H100'e kıyasla 30 kat performans iyileştirmesi sunarken enerji tüketimini 25 kat azaltır. Önceden 256 Hopper GPU gerektiren iş yükleri artık yalnızca 64 Blackwell GPU ile yürütülebilmektedir. Google, Meta, Microsoft ve Amazon gibi hiper ölçekli şirketler büyük yapay zeka modellerinin eğitimi ve çıkarım altyapısı için Blackwell'i benimsemiştir. NVIDIA bu teknolojiyi yapay zeka fabrikaları olarak konumlandırmakta ve trilyon parametreli modellerin ticari ölçekte çalışmasını mümkün kılan hesaplama altyapısı olarak tanımlamaktadır.

Blackwell: NVIDIA'nın Beşinci Nesil GPU Mimarisi

Blackwell, NVIDIA'nın Mart 2024'te tanıttığı beşinci nesil GPU mimarisidir; olasılık teorisine katkıları olan matematikçi David Blackwell'in adını taşır. TSMC'nin 4NP süreci üzerinde çift-die (dual-die) chiplet tasarımıyla üretilir ve toplamda 208 milyar transistör içerir — selefi Hopper/H100'ün neredeyse iki katı. Amiral gemisi GPU olarak B200 ve bunun NVL72 rafına yerleştirilen topluluk versiyonu çıkarılmıştır. FP4 ve FP8 hassasiyette Transformer Engine 2.0 ile birlikte çalışan Blackwell, büyük dil modeli eğitimi ve çıkarımında Hopper nesline kıyasla 4-30× performans artışı iddia etmektedir.

Teknik Özellikler

  • check_circle Chiplet Mimarisi: İki GPU zarı (die) tek paket üzerinde 10 TB/s bant genişlikli NVLink-C2C ara bağlantısıyla birleştiriliyor; bu mimari tek büyük bir die yerine daha yüksek verim sağlar.
  • check_circle 208 Milyar Transistör: H100'ün 80 milyar transistörüne kıyasla 2.6× artış; 4NP EUV süreci sayesinde mümkün oldu. Bu yoğunluk Tensor Core operasyonlarının paralel sayısını önemli ölçüde artırır.
  • check_circle Transformer Engine 2.0: FP4 ve FP8 hassasiyetinde ağırlıkları ve aktivasyonları dinamik olarak ölçeklendirir; LLM eğitiminde bellek ve hesaplama verimliliğini artırır. FP8 ile Hopper'a kıyasla yaklaşık 2× daha fazla TFLOPS elde edilir.
  • check_circle HBM3e Bellek: B200 GPU'da 192 GB HBM3e bellek ve 8 TB/s bellek bant genişliği sunulur; bu rakam H100'ün 80 GB / 3.35 TB/s'ini önemli ölçüde aşar ve 70B+ parametreli modellerin tek GPU'da çalışmasını mümkün kılar.
  • check_circle RAS (Reliability, Availability, Serviceability): ECC koruması, bellek onarım teknolojisi ve canlı yazılım güncellemesi gibi kurumsal güvenilirlik özellikleri eklenmiştir; uzun süren LLM eğitimlerinde hata toleransını artırır.

Ürün Ailesi

  • check_circle B100: Daha düşük güç tüketimiyle (700W) HPC ve AI çıkarım iş yükleri için tasarlanan giriş seviyesi Blackwell GPU. H100 ile aynı PCIe formunda kullanılabilir.
  • check_circle B200: Amiral gemisi 1000W GPU; 192 GB HBM3e ile H100 SXM5'in maksimum çıkarım performansını 4× geçer. NVLink 5.0 ile GB200 süper çipine entegre edilir.
  • check_circle GB200 NVL72: 36 Grace CPU + 72 Blackwell GPU'yu NVLink üzerinden birleştiren veri merkezi rafı sistemi; tek bir raf 1.4 exaFLOPS (FP4) çıkarım gücü sunar. AI fabrika konseptinin fiziksel tezahürü.
  • check_circle RTX 5090 (GeForce Blackwell): Tüketici versiyonu; 32 GB GDDR7, 3352 Tensor Çekirdeği. Oyuncu ve yaratıcı iş yükleri için Hopper'ın tüketici karşılığı Ada Lovelace'i geçer.

AI ve LLM Üretimindeki Etkisi

  • check_circle Eğitim Hızlanması: GPT-4 ölçeğindeki modellerin eğitim süresi H100 kümesine kıyasla 3-4× azalabilir; FP8 Transformer Engine 2.0 ve daha büyük bellek bant genişliği birlikte etkili olur.
  • check_circle Çıkarım Verimliliği: FP4 hassasiyetle token üretim hızı H100'e kıyasla çarpıcı biçimde artmaktadır; bu, daha düşük maliyet/token ve daha fazla eş zamanlı kullanıcı anlamına gelir.
  • check_circle Büyük Model Tek GPU'da: 192 GB bellek sayesinde 70B parametreli LLaMA-3 veya benzeri modeller tek B200 üzerinde FP8 hassasiyetle çalışabilir; model paralelizmini azaltır ve gecikmeyi düşürür.

Blackwell Nesli Ürün Ailesi

GB200 NVL72

72 adet Blackwell GPU + 36 Grace CPU; 1.4 exaFLOPS FP4 hesaplama gücüyle büyük LLM eğitimi için referans konfigürasyon.

RTX 5090

Tüketici flagshipi; 92 milyar transistor, 32 GB GDDR7 bellek ve DLSS 4 Multi Frame Generation ile oyun ve içerik üretiminde yeni standart.

B200 PCIe

Veri merkezi çıkarım kartı; H100'e göre 2.5x LLM çıkarım verimi artışı, 192 GB HBM3e bellek kapasitesi.

GeForce RTX 5080

Orta-üst segment; 16 GB GDDR7 ve Transformer Engine desteğiyle AI destekli içerik üretimi ve yerel LLM çıkarımı için güçlü seçenek.

Sık Sorulan Sorular

  • check_circle Blackwell Hopper (H100) ile geriye dönük uyumlu mu? CUDA yazılım ekosistemleri (PyTorch, TensorFlow) Blackwell'i tam destekler. Fiziksel form faktörü ve güç gereksinimleri farklıdır; H100 raflarına doğrudan takılmaz, GB200 NVL72 kendi altyapısını gerektirir.
  • check_circle FP4 hassasiyeti ne kadar güvenilir? LLM çıkarımında FP4 dikkatli kuantizasyon ve kalibrasyon ile kabul edilebilir doğruluk kaybı gösterir. Eğitim için FP8, çıkarım için FP4 şeklinde karma hassasiyet stratejisi en yaygın yaklaşımdır.
  • check_circle NVLink 5.0 neyi değiştiriyor? GPU'lar arasındaki bant genişliğini 1.8 TB/s'ye çıkarır (NVLink 4.0'in yaklaşık iki katı); GB200 NVL72 içindeki 72 GPU tek bir büyük bellek alanı gibi programlanabilir.
  • check_circle Blackwell'in rekabetçi konumu nedir? AMD MI300X, Google TPU v5e ve AWS Trainium 2 ile rekabet eder. Ekosistem olgunluğu (CUDA), yazılım desteği ve ölçek ekonomisi NVIDIA'nın en güçlü avantajı olmaya devam etmektedir.
  • check_circle Tüketici düzeyinde Blackwell ne zaman çıktı? GeForce RTX 5090/5080 serisi Ocak 2025 CES'te duyuruldu; RTX 5090 32 GB GDDR7 ile oyun ve yaratıcı iş yüklerinde Ada Lovelace neslini geride bırakmaktadır.