Hopper Mimarisinin Teknik Özellikleri
- check_circle Bellek: 80 GB HBM3, 3,35 TB/sn bant genişliği (SXM5 formunda)
- check_circle Hesaplama: FP8 seyrek: 4 petaFLOPS; FP16 seyrek: 2 petaFLOPS
- check_circle Güç Tüketimi: SXM5: 700 W; PCIe: 350 W
- check_circle Bağlantı: NVLink 4.0 — 900 GB/sn çift yönlü bant genişliği
- check_circle Transistör Sayısı: 80 milyar (GH100 die, TSMC 4N süreci)
Transformer Engine ve FP8 Desteği
H100'ün en kritik yeniliği, dördüncü nesil Tensor Core'ların üzerine inşa edilen Transformer Engine'dir. Bu bileşen, sinir ağı eğitimi sırasında katman bazında hangi hassasiyet biçiminin kullanılacağına otomatik karar verir: ağırlık güncellemelerinde daha düşük hassasiyete tolerans gösterildiğinde FP8'e, kritik aktivasyonlar için BF16/FP16'ya geçer. Böylece A100'e kıyasla eğitim hızı ortalama 3-6 kat artar, model kalitesinde kayıp yaşanmaz.
Çok-GPU Ölçeklendirme: NVLink ve NVSwitch
H100 SXM5, NVLink 4.0 standardını destekler. Tek sunucu düğümündeki 8 H100, NVSwitch üzerinden birbirine bağlanarak toplam 900 GB/sn bant genişliğine ulaşır. Bu mimari, model paralelliği tekniklerinin verimliliğini artırır; modelin farklı katmanları farklı GPU'lara dağıtılabilir. GPT-4 veya Llama 3.1 405B gibi yüzlerce milyar parametreli modeller bu özellik ile pratik eğitim sürelerine kavuşur.
Kullanım Alanları
- check_circle LLM Eğitimi: GPT-4, Llama, Mistral ve Claude gibi modellerin ön eğitimi H100 kümelerinde gerçekleştirilmektedir.
- check_circle İnce Ayar (Fine-tuning): Büyük taban modellerin domain-spesifik veriyle özelleştirilmesi.
- check_circle Çıkarım (Inference): Düşük gecikme gerektiren üretim ortamında LLM servis altyapısı.
- check_circle Görüntü ve Video Üretimi: Stable Diffusion ve video üretim modellerinde yüksek hızlı rendering.
- check_circle Bilimsel Simülasyon: İklim modelleri, ilaç keşfi ve fizik simülasyonları için HPC iş yükleri.
H100'ün Ardılları: H200 ve Blackwell
NVIDIA, H100'ün ardından 2023 sonunda H200'ü duyurdu. H200, aynı Hopper mimarisini korurken belleği 141 GB HBM3e'ye yükseltiyor ve bant genişliğini 4,8 TB/sn'ye taşıyor. 2024-2025 döneminde sunulan Blackwell mimarisi (B100, B200, GB200) ise yeni bir nesil Tensor Core ve geliştirilmiş NVLink 5.0 ile FP4 hassasiyeti getirerek H100 kümeleriyle geriye dönük uyumluluk koruyor.
Sık Sorulan Sorular
- check_circle H100 ile A100 arasındaki temel fark nedir?: H100, A100'e kıyasla FP8 desteği ve Transformer Engine ile LLM eğitiminde 3-6 kat daha hızlı; ayrıca HBM3 bellekle daha yüksek bant genişliği sunar.
- check_circle H100'e bulut üzerinden nasıl erişilir?: AWS (p4de/p5 instance), Azure (ND H100 v5), Google Cloud (A3 VM) ve CoreWeave gibi bulut sağlayıcıları H100 tabanlı örnekler sunar.
- check_circle H100 SXM5 ile PCIe formu arasında ne fark var?: SXM5, 700 W güçte çalışır ve NVLink 4.0 tam desteğiyle daha yüksek GPU arası bant genişliği sağlar; PCIe formu 350 W tüketir ve standart sunucu yapılarına uyar.
- check_circle H100 kaç GB RAM destekler?: Standart H100 modeli 80 GB HBM3 bellek içerir; H200 ise 141 GB HBM3e ile bu sınırı genişletir.
- check_circle H100'ün enerji tüketimi yüksek mi?: SXM5 formunda 700 W güç harcar. 8 GPU içeren bir sunucu düğümü yaklaşık 5-6 kW çeker; bu da veri merkezi soğutma altyapısı açısından ciddi bir gereksinim anlamına gelir.