AI Modellerinde VRAM Neden Kritik?
GPU'da çıkarım yapmak için modelin tüm ağırlıklarının VRAM'e sığması gerekir; disk veya sistem RAM'inden parça parça okumak pratikte kullanılamayacak kadar yavaştır. Kaba hesap basittir: parametre sayısı × parametre başına bayt. FP16/BF16'da parametre başına 2 bayt düşer; 7B model 14 GB, 13B model 26 GB, 70B model 140 GB ister. INT8 bu değerleri yarıya, INT4 dörtte bire indirir. Ağırlıklar tek kalem değildir: Transformer çıkarımında her üretilen token için saklanan KV cache, bağlam ve batch büyüdükçe şişer; 70B bir modelde 128K bağlam onlarca GB ek bellek isteyebilir. Eğitimde tablo daha da ağırlaşır, çünkü optimizer durumları ve geri yayılım aktivasyonları ağırlıkların 3-4 katı yer kaplar. Bu yüzden 24 GB'lık bir kartta 13B modeli rahat çalıştırıp aynı modeli tam ince ayarla eğitememek olağandır; çözüm LoRA/QLoRA gibi bellek dostu yöntemlerdir.
2026'da Popüler GPU'ların VRAM Kapasitesi
computer RTX 5090 — 32 GB GDDR7
Tüketici segmentinin zirvesi; 1,79 TB/s bant genişliğiyle 32B sınıfı modelleri INT4'te, 13B'yi FP16'da rahat çalıştırır.
desktop RTX 4090 / 3090 — 24 GB
Yerel AI'ın fiyat/performans klasiği; 13B FP16, 30B INT4 ve QLoRA ince ayarı için yeterli.
cloud H100 / H200 — 80 / 141 GB HBM3(e)
Veri merkezi standardı; H200'ün 141 GB'ı 70B modeli tek kartta FP8 ile barındırır.
rocket Blackwell B200 — 192 GB HBM3e
NVIDIA'nın 2024-2026 amiral gemisi; 8 TB/s bant genişliği ve FP4 desteğiyle trilyon parametreli sistemlerin yapı taşı.
apple Apple M3 Ultra — 512 GB Unified
CPU-GPU ortak bellek havuzu; DeepSeek R1 671B'nin 4-bit sürümü gibi devasa modelleri tek makinede çalıştırabilir.
chip AMD MI300X — 192 GB HBM3
NVIDIA'ya veri merkezi alternatifi; tek kartta 70B FP16 çıkarımı için yeterli kapasite sunar.
Oyun ve Yapay Zeka: İki Farklı VRAM İhtiyacı
Oyunlarda VRAM doku (texture), gölge haritaları ve kare tamponlarını tutar; 1080p için 8 GB, 4K ve ışın izleme için 12-16 GB genelde yeterlidir ve kapasite aşımı kare hızı düşüşüyle kendini belli eder. Yapay zekada ise eşik ikili çalışır: model sığıyorsa çalışır, sığmıyorsa ya hata verir ya da CPU offload ile 10 kata varan yavaşlama yaşanır. İkinci fark bant genişliğidir. LLM çıkarımı bellek bantına bağlı (memory-bound) bir iştir; üretilen her token için tüm ağırlıklar bellekten okunur. Bu yüzden token/saniye hızını çekirdek sayısından çok bellek hızı belirler: 1 TB/s bantlı bir kart, aynı çekirdek gücünde 500 GB/s'lik karttan yaklaşık iki kat hızlı token üretir. Görüntü üretiminde de benzer tablo geçerlidir: SDXL için 8-10 GB, Flux.1 dev için FP8 ile 12-16 GB VRAM pratik alt sınırdır. Oyun için yeterli bir kart, AI için dar kalabilir; tersine AI odaklı yüksek VRAM'li kartlar oyunda fazladan avantaj getirmez.
VRAM Tüketimini Azaltan Teknikler
- check_circle Kuantizasyon (INT8 / INT4 / FP4): Ağırlıkların hassasiyetini düşürerek boyutu 2-4 kat küçültür; GGUF Q4_K_M ve AWQ, kalite kaybını yüzde birkaç seviyede tutar.
- check_circle LoRA / QLoRA: Tam ince ayar yerine küçük adaptör matrisleri eğitir; 70B modelin QLoRA ile 48 GB tek kartta ince ayarı mümkündür.
- check_circle FlashAttention ve Paged KV Cache: Attention hesabını bellek dostu bloklara böler; vLLM'in PagedAttention'ı KV cache israfını yüzde 60-80 azaltır.
- check_circle Gradient Checkpointing: Eğitimde aktivasyonları saklamak yerine geri yayılımda yeniden hesaplar; yaklaşık yüzde 30 hız karşılığında ciddi bellek kazanımı verir.
- check_circle Tensor / Pipeline Parallelism: Modeli birden fazla GPU'ya böler; NVLink (H100'de 900 GB/s) kartlar arası aktarım darboğazını azaltır.
- check_circle CPU / Disk Offload: Sığmayan katmanları RAM'e taşır; llama.cpp'nin katman bölüştürmesi yavaş ama çalışır bir son çaredir.
Birleşik Bellek: Apple Silicon ve Yeni Mimariler
Klasik PC mimarisinde VRAM ve sistem RAM'i ayrıdır; veriler PCIe üzerinden (5.0 x16'da ~64 GB/s) kopyalanır ve bu hat, HBM'in 3-8 TB/s hızının yanında dar bir boğazdır. Apple Silicon bu ayrımı kaldırır: M serisi çiplerde CPU ve GPU tek bellek havuzunu paylaşır. M4 Max 128 GB'a kadar, M3 Ultra 512 GB'a kadar birleşik bellek sunar ve 800 GB/s'yi aşan bant genişliğiyle 70B-120B sınıfı modelleri tek makinede çalıştırır; 4-bit kuantize DeepSeek R1 671B'nin M3 Ultra üzerinde koşturulması bu mimarinin simge örneğidir. NVIDIA da aynı yöne ilerliyor: Grace Hopper ve GB200 süper çiplerinde CPU-GPU belleği NVLink-C2C ile 900 GB/s hızında birleşirken, 2025'te çıkan DGX Spark (GB10) 128 GB birleşik bellekli kompakt bir yerel AI istasyonu sunar. Birleşik belleğin bedeli ham GPU gücüdür: aynı modelde token üretim hızı genelde ayrık VRAM'li üst düzey NVIDIA kartların gerisinde kalır, ancak kapasite/fiyat oranı büyük modeller için çekicidir.
Hangi İş İçin Kaç GB VRAM? Pratik Seçim Rehberi
Kullanım amacına göre 2026 pratiği şöyle özetlenebilir. 8 GB: 7B-8B modeller INT4'te (Llama 3.1 8B, Qwen3 8B), SD 1.5 görüntü üretimi — giriş seviyesi. 12-16 GB: 13-14B INT4, SDXL ve FP8 Flux; RTX 4070 Ti Super / 5070 Ti sınıfı. 24 GB: yerel AI'ın tatlı noktası; 32B INT4 (Qwen3 32B, Gemma 3 27B), 13B FP16 ve 7B QLoRA ince ayarı. 32 GB (RTX 5090): 70B modellerin agresif kuantize sürümlerine yaklaşır, uzun bağlamda 32B'yi rahatlatır. 48-96 GB (RTX 6000 Ada, A6000, çift 4090): 70B INT4 çıkarımı ve QLoRA ince ayarı. 141-192 GB (H200, B200, MI300X): 70B FP16, 100B+ modeller ve ciddi eğitim işleri. Bulut kiralama saatlik 2-10 dolar bandındayken, günde birkaç saatlik kullanım için satın alma yerine kiralama çoğu zaman daha ekonomiktir. Kural: hedef modelin kuantize boyutu + bağlam için yüzde 20-30 pay = ihtiyacınız olan VRAM.
Sık Sorulan Sorular
- check_circle VRAM nedir, ne işe yarar?: VRAM, GPU'nun üzerindeki yüksek hızlı bellektir. Oyunlarda dokuları ve kare tamponlarını, yapay zekada model ağırlıklarını ve KV cache'i tutar; kapasitesi hangi modelin çalışabileceğini belirler.
- check_circle VRAM ile RAM arasındaki fark nedir?: RAM CPU'ya, VRAM GPU'ya hizmet eder. VRAM'in bant genişliği çok daha yüksektir (GDDR7 ~1,8 TB/s, HBM3e ~8 TB/s; DDR5 ~64-100 GB/s) ama kapasitesi genelde daha düşüktür.
- check_circle Yapay zeka için kaç GB VRAM gerekir?: 7-8B model INT4 için 6-8 GB, 13B için 10-12 GB, 32B için 20-24 GB, 70B için 35-48 GB gerekir. FP16 çalıştırmak bu değerleri yaklaşık 4 kat büyütür.
- check_circle VRAM yetmezse ne yapılır?: Sırasıyla denenir: 4-bit kuantizasyon (GGUF/AWQ), daha küçük model, bağlam penceresini kısaltma, CPU offload veya çoklu GPU. İnce ayar için QLoRA + gradient checkpointing kullanılır.
- check_circle Ekran kartının VRAM'i artırılabilir mi?: Hayır; VRAM yongaları karta lehimlidir ve son kullanıcı tarafından yükseltilemez. Daha fazla bellek için yeni kart, ikinci GPU veya birleşik bellekli sistem (Mac, DGX Spark) gerekir.
- check_circle Apple'ın birleşik belleği VRAM yerine geçer mi?: Evet, kapasite açısından geçer: M serisi çiplerde GPU tüm birleşik belleğe erişir ve 512 GB'a kadar model yüklenebilir. Ancak token üretim hızı genelde eşdeğer NVIDIA kartların altındadır.