Memory Bandwidth (Bellek Bant Genişliği)

Bir işlemcinin bellek sistemi ile saniye başına aktarabildiği maksimum veri miktarı; LLM çıkarımında performansın temel kısıtlayıcısı.

Bellek bant genişliği (memory bandwidth), bir işlemci ya da hızlandırıcının bellek sistemiyle veri alışverişini saniyede gerçekleştirebileceği maksimum kapasitedir. GB/s veya TB/s birimiyle ölçülen bu metrik, yapay zeka iş yüklerinin büyük çoğunluğu için ham işlem gücünden çok daha belirleyici bir performans faktörü olmaktadır. Bant genişliği, bellek teknolojisi ve veri yolu genişliğiyle doğrudan orantılıdır. DDR5 sistem belleği yaklaşık 100 GB/s sunarken GDDR6X (RTX 4090) 1 TB/s düzeyine, HBM2e (A100) ise 2 TB/s'ye ulaşmaktadır. H100 SXM5'in kullandığı HBM3 teknolojisi 3,35 TB/s ile günümüzdeki en yüksek değerleri temsil etmektedir. Apple M serisi çipler, CPU ve GPU'nun ortak eriştiği birleşik bellek (unified memory) mimarisiyle yaklaşık 400 GB/s bant genişliği ve düşük güç tüketimi kombinasyonunu kenar cihazlara taşır. Büyük dil modellerinin (LLM) çıkarım aşamasında bant genişliği kritik öneme sahiptir. 70 milyar parametreli bir model FP16 hassasiyetiyle 140 GB yer kaplar; her yeni token üretiminde bu ağırlıkların büyük bölümü bellekten işlemciye aktarılır. Matris-vektör çarpımına dayalı bu işlemlerin aritmetik yoğunluğu düşük olduğundan sistem bellek sınırlı (memory-bound) biçimde çalışır: hesap kapasitesi artırılsa bile bant genişliği yeterli değilse token üretim hızı iyileşmez. Roofline modeli bu dengeyi görselleştirir ve bir çekirdeğin nerede darboğaz oluşturduğunu açıkça ortaya koyar. Yatay eksen aritmetik yoğunluğu (FLOP/bayt), dikey eksen ise ulaşılabilir performansı (TFLOPS) gösterir. Bant genişliği kısıtını aşmak için FlashAttention algoritması HBM trafiğini O(n²) düzeyinden O(n) düzeyine indirirken, model nicelleştirme (FP32'den INT4'e dönüşüm) ağırlık boyutunu sekiz kat küçülterek aynı bant genişliğinden sekiz kat daha fazla token üretilmesine olanak tanır. NVLink ve CXL tabanlı bellek genişletme teknolojileri de bant genişliği kapasitesini artırmak için yaygın biçimde başvurulan çözümler arasındadır.

Nedir ve Nasıl Ölçülür?

Bellek bant genişliği, işlemci ile DRAM arasındaki veri yolunun saniyedeki maksimum kapasitesidir. Sintetik kıyaslamalar (Stream benchmark) veya üretici teknik özellikleri (pin hızı × veri yolu genişliği × 2) aracılığıyla GB/s ya da TB/s cinsinden ifade edilir. Gerçek iş yüklerinde elde edilen bant genişliği, bellek kontrol cihazı verimliliği ve bellek erişim kalıplarına bağlı olarak teorik maksimumun %60-90'ı arasında kalır.

Donanım Karşılaştırması

  • check_circle HBM3 (H100 SXM5): ~3,35 TB/s — yüksek yoğunluklu AI sunucu kümelerinin tercihi.
  • check_circle HBM2e (A100, TPU v4): ~2 TB/s — önceki nesil AI hızlandırıcılar.
  • check_circle GDDR6X (RTX 4090): ~1 TB/s — tüketici sınıfı GPU'larda görülen üst limit.
  • check_circle LPDDR5X (Apple M3 Max): ~400 GB/s — uç bilgi işlem ve on-device AI için optimize.
  • check_circle DDR5 (CPU sistem belleği): ~100 GB/s — CPU çıkarım iş yüklerinin gerçek darboğazı.

LLM Çıkarımında Neden Önemli?

Transformer mimarisinin her adımında model ağırlıkları bellekten işlemciye yüklenir. 70B parametreli bir model FP16 hassasiyetiyle 140 GB yer kaplar; her token üretiminde bu verinin büyük bölümü okunur. Hesaplamanın çoğu basit matris-vektör çarpımından oluştuğu için aritmetik yoğunluk düşüktür ve sistem bellek sınırlı (memory-bound) çalışır. Bu koşulda daha hızlı GPU değil, daha geniş bant genişliği token/saniye değerini artırır.

Roofline Modeli

Roofline analizi, bir çekirdeğin hesaplama sınırlı mı yoksa bellek sınırlı mı olduğunu görselleştirir. Yatay eksen aritmetik yoğunluğu (FLOP/bayt), dikey eksen ulaşılabilir performansı (FLOPS) gösterir. Attention ve aktivasyon katmanları genellikle bellek duvarının solunda kalır; büyük matris çarpımları sağ tarafa (hesaplama sınırlı) taşınabilir. FlashAttention, bellek trafiğini azaltarak attention çekirdeğini roofline üzerinde daha ileriye taşır.

Bant Genişliğini Artıran Teknolojiler

  • check_circle HBM (High Bandwidth Memory): 2D/3D yığınlı DRAM mimarisi; geniş paralel veri yolu ile GDDR'den 3-5 kat fazla bant genişliği sunar.
  • check_circle NVLink / NVSwitch: NVIDIA GPU'lar arası yüksek bant genişliği köprüsü; PCIe sınırını aşarak 900 GB/s çift yönlü aktarım (H100 NVLink) imkânı tanır.
  • check_circle CXL (Compute Express Link): CPU, GPU ve bellek genişletme modülleri arasında bant genişliğini paylaştıran açık standart.
  • check_circle In-Memory Computing: Hesaplamayı verinin fiziksel konumuna taşıyarak bellek-işlemci gecikmesini ortadan kaldırır.
  • check_circle Model Nicelleştirme: FP32→INT4 dönüşümü ağırlık boyutunu 8 kat küçülterek aynı bant genişliğinden 8 kat daha fazla token üretilmesine olanak tanır.

Sık Sorulan Sorular

  • check_circle VRAM ile bellek bant genişliği aynı şey midir? Hayır. VRAM, GPU'nun toplam bellek kapasitesidir (ör. 80 GB). Bellek bant genişliği ise o belleğe erişim hızıdır (ör. 3,35 TB/s). Kapasite ne kadar büyük model yüklenebileceğini, bant genişliği ise çıkarım hızını belirler.
  • check_circle CPU'da LLM çalıştırmak neden yavaş? DDR5 sistem belleği ~100 GB/s bant genişliği sunarken GPU HBM3 3,35 TB/s'ye ulaşır. Bu 30 kat fark, aynı modelin CPU'da GPU'ya kıyasla 10-30 kat daha yavaş çalışmasını açıklar.
  • check_circle Nicelleştirme bant genişliği sorununu çözer mi? Kısmen. INT4 ile ağırlık boyutu küçülür ve aynı bant genişliğiyle daha fazla token üretilir. Ancak nicelleştirme hassasiyet kaybı getirir ve aktivasyon bant genişliği gereksinimini tam azaltmaz.
  • check_circle Apple Silicon'un bellek avantajı nedir? Apple M serisi çipler CPU ve GPU'nun ortak eriştiği birleşik bellek (unified memory) kullanır. LPDDR5X ile ~400 GB/s sunar; yüksek bant genişliği ve düşük güç tüketimi kombinasyonu on-device AI için idealdir.
  • check_circle FlashAttention bant genişliğini nasıl optimize eder? Standart attention HBM'den O(n²) boyutunda matris okur; FlashAttention hesaplamayı SRAM'de tamamlayarak HBM trafiğini O(n) seviyesine düşürür. Bu 5-20× hızlanma ve %90+ bellek tasarrufu sağlar.