NVIDIA H100

NVIDIA'nın Hopper mimarisi üzerine kurulu, büyük dil modeli eğitiminde endüstri standardı haline gelen yüksek performanslı veri merkezi GPU'su.

NVIDIA H100, 2022 yılında duyurulan ve Hopper mikromimarisi (GH100 die) üzerine inşa edilen yüksek performanslı veri merkezi GPU'sudur. GPT-4, Llama ve diğer büyük dil modelleri dahil pek çok öncü yapay zeka modelinin eğitiminde kullanılan H100, bu alanda endüstri standardı konumuna gelmiştir. H100'ün en dikkat çekici yeniliği Transformer Engine'dir. Bu bileşen, FP8 ile FP16/BF16 hassasiyeti arasında katman bazında otomatik geçiş yaparak hem hesaplama hızını hem de model doğruluğunu korur. FP8 modunda seyrek (sparse) matris çarpımında 4 petaFLOPS, FP16'da ise 2 petaFLOPS zirve kapasitesine ulaşır. Bellek cephesinde, 80 GB HBM3 ve 3,35 TB/sn bant genişliğiyle büyük model ağırlıklarını verimli şekilde barındırır. NVLink 4.0 ile çip başına 900 GB/sn çift yönlü bant genişliği sağlanır; NVSwitch aracılığıyla 16 H100'ün sorunsuzca birbirine bağlanmasına olanak tanır. Bu ölçeklendirme kabiliyeti, yüzlerce milyar parametreli modellerin eğitimini pratik hale getirir. H100, SXM5 (sunucu kartı, 700 W) ve PCIe (350 W) olmak üzere iki formda sunulur. AWS, Microsoft Azure ve Google Cloud gibi büyük bulut sağlayıcıları H100 tabanlı sanal makine örnekleri sunar; piyasa fiyatı birim başına 25.000–40.000 ABD doları aralığındadır. Ardından gelen H200 modeli 141 GB HBM3e bellekle geliştirilmiş; Blackwell mimarisindeki B100 ve B200 serileri ise performans çıtasını daha da yükseltmiştir.

Hopper Mimarisinin Teknik Özellikleri

  • check_circle Bellek: 80 GB HBM3, 3,35 TB/sn bant genişliği (SXM5 formunda)
  • check_circle Hesaplama: FP8 seyrek: 4 petaFLOPS; FP16 seyrek: 2 petaFLOPS
  • check_circle Güç Tüketimi: SXM5: 700 W; PCIe: 350 W
  • check_circle Bağlantı: NVLink 4.0 — 900 GB/sn çift yönlü bant genişliği
  • check_circle Transistör Sayısı: 80 milyar (GH100 die, TSMC 4N süreci)

Transformer Engine ve FP8 Desteği

H100'ün en kritik yeniliği, dördüncü nesil Tensor Core'ların üzerine inşa edilen Transformer Engine'dir. Bu bileşen, sinir ağı eğitimi sırasında katman bazında hangi hassasiyet biçiminin kullanılacağına otomatik karar verir: ağırlık güncellemelerinde daha düşük hassasiyete tolerans gösterildiğinde FP8'e, kritik aktivasyonlar için BF16/FP16'ya geçer. Böylece A100'e kıyasla eğitim hızı ortalama 3-6 kat artar, model kalitesinde kayıp yaşanmaz.

Çok-GPU Ölçeklendirme: NVLink ve NVSwitch

H100 SXM5, NVLink 4.0 standardını destekler. Tek sunucu düğümündeki 8 H100, NVSwitch üzerinden birbirine bağlanarak toplam 900 GB/sn bant genişliğine ulaşır. Bu mimari, model paralelliği tekniklerinin verimliliğini artırır; modelin farklı katmanları farklı GPU'lara dağıtılabilir. GPT-4 veya Llama 3.1 405B gibi yüzlerce milyar parametreli modeller bu özellik ile pratik eğitim sürelerine kavuşur.

Kullanım Alanları

  • check_circle LLM Eğitimi: GPT-4, Llama, Mistral ve Claude gibi modellerin ön eğitimi H100 kümelerinde gerçekleştirilmektedir.
  • check_circle İnce Ayar (Fine-tuning): Büyük taban modellerin domain-spesifik veriyle özelleştirilmesi.
  • check_circle Çıkarım (Inference): Düşük gecikme gerektiren üretim ortamında LLM servis altyapısı.
  • check_circle Görüntü ve Video Üretimi: Stable Diffusion ve video üretim modellerinde yüksek hızlı rendering.
  • check_circle Bilimsel Simülasyon: İklim modelleri, ilaç keşfi ve fizik simülasyonları için HPC iş yükleri.

H100'ün Ardılları: H200 ve Blackwell

NVIDIA, H100'ün ardından 2023 sonunda H200'ü duyurdu. H200, aynı Hopper mimarisini korurken belleği 141 GB HBM3e'ye yükseltiyor ve bant genişliğini 4,8 TB/sn'ye taşıyor. 2024-2025 döneminde sunulan Blackwell mimarisi (B100, B200, GB200) ise yeni bir nesil Tensor Core ve geliştirilmiş NVLink 5.0 ile FP4 hassasiyeti getirerek H100 kümeleriyle geriye dönük uyumluluk koruyor.

Sık Sorulan Sorular

  • check_circle H100 ile A100 arasındaki temel fark nedir?: H100, A100'e kıyasla FP8 desteği ve Transformer Engine ile LLM eğitiminde 3-6 kat daha hızlı; ayrıca HBM3 bellekle daha yüksek bant genişliği sunar.
  • check_circle H100'e bulut üzerinden nasıl erişilir?: AWS (p4de/p5 instance), Azure (ND H100 v5), Google Cloud (A3 VM) ve CoreWeave gibi bulut sağlayıcıları H100 tabanlı örnekler sunar.
  • check_circle H100 SXM5 ile PCIe formu arasında ne fark var?: SXM5, 700 W güçte çalışır ve NVLink 4.0 tam desteğiyle daha yüksek GPU arası bant genişliği sağlar; PCIe formu 350 W tüketir ve standart sunucu yapılarına uyar.
  • check_circle H100 kaç GB RAM destekler?: Standart H100 modeli 80 GB HBM3 bellek içerir; H200 ise 141 GB HBM3e ile bu sınırı genişletir.
  • check_circle H100'ün enerji tüketimi yüksek mi?: SXM5 formunda 700 W güç harcar. 8 GPU içeren bir sunucu düğümü yaklaşık 5-6 kW çeker; bu da veri merkezi soğutma altyapısı açısından ciddi bir gereksinim anlamına gelir.