Nedir ve Nasıl Ölçülür?
Bellek bant genişliği, işlemci ile DRAM arasındaki veri yolunun saniyedeki maksimum kapasitesidir. Sintetik kıyaslamalar (Stream benchmark) veya üretici teknik özellikleri (pin hızı × veri yolu genişliği × 2) aracılığıyla GB/s ya da TB/s cinsinden ifade edilir. Gerçek iş yüklerinde elde edilen bant genişliği, bellek kontrol cihazı verimliliği ve bellek erişim kalıplarına bağlı olarak teorik maksimumun %60-90'ı arasında kalır.
Donanım Karşılaştırması
- check_circle HBM3 (H100 SXM5): ~3,35 TB/s — yüksek yoğunluklu AI sunucu kümelerinin tercihi.
- check_circle HBM2e (A100, TPU v4): ~2 TB/s — önceki nesil AI hızlandırıcılar.
- check_circle GDDR6X (RTX 4090): ~1 TB/s — tüketici sınıfı GPU'larda görülen üst limit.
- check_circle LPDDR5X (Apple M3 Max): ~400 GB/s — uç bilgi işlem ve on-device AI için optimize.
- check_circle DDR5 (CPU sistem belleği): ~100 GB/s — CPU çıkarım iş yüklerinin gerçek darboğazı.
LLM Çıkarımında Neden Önemli?
Transformer mimarisinin her adımında model ağırlıkları bellekten işlemciye yüklenir. 70B parametreli bir model FP16 hassasiyetiyle 140 GB yer kaplar; her token üretiminde bu verinin büyük bölümü okunur. Hesaplamanın çoğu basit matris-vektör çarpımından oluştuğu için aritmetik yoğunluk düşüktür ve sistem bellek sınırlı (memory-bound) çalışır. Bu koşulda daha hızlı GPU değil, daha geniş bant genişliği token/saniye değerini artırır.
Roofline Modeli
Roofline analizi, bir çekirdeğin hesaplama sınırlı mı yoksa bellek sınırlı mı olduğunu görselleştirir. Yatay eksen aritmetik yoğunluğu (FLOP/bayt), dikey eksen ulaşılabilir performansı (FLOPS) gösterir. Attention ve aktivasyon katmanları genellikle bellek duvarının solunda kalır; büyük matris çarpımları sağ tarafa (hesaplama sınırlı) taşınabilir. FlashAttention, bellek trafiğini azaltarak attention çekirdeğini roofline üzerinde daha ileriye taşır.
Bant Genişliğini Artıran Teknolojiler
- check_circle HBM (High Bandwidth Memory): 2D/3D yığınlı DRAM mimarisi; geniş paralel veri yolu ile GDDR'den 3-5 kat fazla bant genişliği sunar.
- check_circle NVLink / NVSwitch: NVIDIA GPU'lar arası yüksek bant genişliği köprüsü; PCIe sınırını aşarak 900 GB/s çift yönlü aktarım (H100 NVLink) imkânı tanır.
- check_circle CXL (Compute Express Link): CPU, GPU ve bellek genişletme modülleri arasında bant genişliğini paylaştıran açık standart.
- check_circle In-Memory Computing: Hesaplamayı verinin fiziksel konumuna taşıyarak bellek-işlemci gecikmesini ortadan kaldırır.
- check_circle Model Nicelleştirme: FP32→INT4 dönüşümü ağırlık boyutunu 8 kat küçülterek aynı bant genişliğinden 8 kat daha fazla token üretilmesine olanak tanır.
Sık Sorulan Sorular
- check_circle VRAM ile bellek bant genişliği aynı şey midir? Hayır. VRAM, GPU'nun toplam bellek kapasitesidir (ör. 80 GB). Bellek bant genişliği ise o belleğe erişim hızıdır (ör. 3,35 TB/s). Kapasite ne kadar büyük model yüklenebileceğini, bant genişliği ise çıkarım hızını belirler.
- check_circle CPU'da LLM çalıştırmak neden yavaş? DDR5 sistem belleği ~100 GB/s bant genişliği sunarken GPU HBM3 3,35 TB/s'ye ulaşır. Bu 30 kat fark, aynı modelin CPU'da GPU'ya kıyasla 10-30 kat daha yavaş çalışmasını açıklar.
- check_circle Nicelleştirme bant genişliği sorununu çözer mi? Kısmen. INT4 ile ağırlık boyutu küçülür ve aynı bant genişliğiyle daha fazla token üretilir. Ancak nicelleştirme hassasiyet kaybı getirir ve aktivasyon bant genişliği gereksinimini tam azaltmaz.
- check_circle Apple Silicon'un bellek avantajı nedir? Apple M serisi çipler CPU ve GPU'nun ortak eriştiği birleşik bellek (unified memory) kullanır. LPDDR5X ile ~400 GB/s sunar; yüksek bant genişliği ve düşük güç tüketimi kombinasyonu on-device AI için idealdir.
- check_circle FlashAttention bant genişliğini nasıl optimize eder? Standart attention HBM'den O(n²) boyutunda matris okur; FlashAttention hesaplamayı SRAM'de tamamlayarak HBM trafiğini O(n) seviyesine düşürür. Bu 5-20× hızlanma ve %90+ bellek tasarrufu sağlar.