VRAM (GPU Belleği)

VRAM, GPU üzerindeki yüksek bant genişlikli bellektir; AI modelinin ağırlıkları ve KV cache burada tutulur.

VRAM (Video RAM), GPU'nun (grafik işlemci birimi) üzerinde bulunan ve model ağırlıkları, aktivasyonlar ile ara hesaplama verilerini tutan yüksek bant genişlikli bellektir. Sistem RAM'i CPU'ya hizmet ederken VRAM doğrudan GPU çekirdeklerine bağlıdır ve GDDR7 ile 1 TB/s'nin üzerinde, HBM3e ile 8 TB/s'ye varan veri aktarım hızına ulaşır. Bu hız farkı, binlerce çekirdeğin aynı anda veri beklediği paralel hesaplamada belirleyicidir. Yapay zeka tarafında VRAM, çalıştırılabilecek modelin üst sınırını çizen ana donanım kısıtıdır. Bir büyük dil modelinin (LLM) tüm ağırlıkları çıkarım sırasında VRAM'e yüklenir: 7B parametreli bir model FP16 hassasiyetle yaklaşık 14 GB, 4-bit kuantizasyonla 4-5 GB yer kaplar; 70B sınıfı bir model ise FP16'da 140 GB isteyip INT4 ile 35-40 GB'a iner. Ağırlıkların üzerine, bağlam uzunluğuyla büyüyen KV cache ve batch verisi eklenir; 128K token bağlam tek başına gigabaytlarca ek VRAM tüketebilir. Kapasite aşıldığında model ya hiç yüklenmez ya da sistem RAM'ine taşarak (CPU offload) on kata varan yavaşlamayla çalışır. 2026 itibarıyla kapasite yelpazesi geniştir: tüketici tarafında RTX 5090 32 GB GDDR7, RTX 4090 24 GB sunar; veri merkezinde H100 80 GB, H200 141 GB, Blackwell B200 ise 192 GB HBM3e taşır. Apple Silicon farklı bir yol izler: M3 Ultra'da 512 GB'a çıkan birleşik bellek (unified memory), CPU ve GPU tarafından ortak kullanılır ve ayrı VRAM kavramını ortadan kaldırır. Yerel LLM çalıştırma, Stable Diffusion/Flux ile görüntü üretme veya LoRA ince ayarı planlayan herkes için ilk sorulacak soru işlemci hızı değil, kaç GB VRAM olduğudur.

AI Modellerinde VRAM Neden Kritik?

GPU'da çıkarım yapmak için modelin tüm ağırlıklarının VRAM'e sığması gerekir; disk veya sistem RAM'inden parça parça okumak pratikte kullanılamayacak kadar yavaştır. Kaba hesap basittir: parametre sayısı × parametre başına bayt. FP16/BF16'da parametre başına 2 bayt düşer; 7B model 14 GB, 13B model 26 GB, 70B model 140 GB ister. INT8 bu değerleri yarıya, INT4 dörtte bire indirir. Ağırlıklar tek kalem değildir: Transformer çıkarımında her üretilen token için saklanan KV cache, bağlam ve batch büyüdükçe şişer; 70B bir modelde 128K bağlam onlarca GB ek bellek isteyebilir. Eğitimde tablo daha da ağırlaşır, çünkü optimizer durumları ve geri yayılım aktivasyonları ağırlıkların 3-4 katı yer kaplar. Bu yüzden 24 GB'lık bir kartta 13B modeli rahat çalıştırıp aynı modeli tam ince ayarla eğitememek olağandır; çözüm LoRA/QLoRA gibi bellek dostu yöntemlerdir.

2026'da Popüler GPU'ların VRAM Kapasitesi

computer RTX 5090 — 32 GB GDDR7

Tüketici segmentinin zirvesi; 1,79 TB/s bant genişliğiyle 32B sınıfı modelleri INT4'te, 13B'yi FP16'da rahat çalıştırır.

desktop RTX 4090 / 3090 — 24 GB

Yerel AI'ın fiyat/performans klasiği; 13B FP16, 30B INT4 ve QLoRA ince ayarı için yeterli.

cloud H100 / H200 — 80 / 141 GB HBM3(e)

Veri merkezi standardı; H200'ün 141 GB'ı 70B modeli tek kartta FP8 ile barındırır.

rocket Blackwell B200 — 192 GB HBM3e

NVIDIA'nın 2024-2026 amiral gemisi; 8 TB/s bant genişliği ve FP4 desteğiyle trilyon parametreli sistemlerin yapı taşı.

apple Apple M3 Ultra — 512 GB Unified

CPU-GPU ortak bellek havuzu; DeepSeek R1 671B'nin 4-bit sürümü gibi devasa modelleri tek makinede çalıştırabilir.

chip AMD MI300X — 192 GB HBM3

NVIDIA'ya veri merkezi alternatifi; tek kartta 70B FP16 çıkarımı için yeterli kapasite sunar.

Oyun ve Yapay Zeka: İki Farklı VRAM İhtiyacı

Oyunlarda VRAM doku (texture), gölge haritaları ve kare tamponlarını tutar; 1080p için 8 GB, 4K ve ışın izleme için 12-16 GB genelde yeterlidir ve kapasite aşımı kare hızı düşüşüyle kendini belli eder. Yapay zekada ise eşik ikili çalışır: model sığıyorsa çalışır, sığmıyorsa ya hata verir ya da CPU offload ile 10 kata varan yavaşlama yaşanır. İkinci fark bant genişliğidir. LLM çıkarımı bellek bantına bağlı (memory-bound) bir iştir; üretilen her token için tüm ağırlıklar bellekten okunur. Bu yüzden token/saniye hızını çekirdek sayısından çok bellek hızı belirler: 1 TB/s bantlı bir kart, aynı çekirdek gücünde 500 GB/s'lik karttan yaklaşık iki kat hızlı token üretir. Görüntü üretiminde de benzer tablo geçerlidir: SDXL için 8-10 GB, Flux.1 dev için FP8 ile 12-16 GB VRAM pratik alt sınırdır. Oyun için yeterli bir kart, AI için dar kalabilir; tersine AI odaklı yüksek VRAM'li kartlar oyunda fazladan avantaj getirmez.

VRAM Tüketimini Azaltan Teknikler

  • check_circle Kuantizasyon (INT8 / INT4 / FP4): Ağırlıkların hassasiyetini düşürerek boyutu 2-4 kat küçültür; GGUF Q4_K_M ve AWQ, kalite kaybını yüzde birkaç seviyede tutar.
  • check_circle LoRA / QLoRA: Tam ince ayar yerine küçük adaptör matrisleri eğitir; 70B modelin QLoRA ile 48 GB tek kartta ince ayarı mümkündür.
  • check_circle FlashAttention ve Paged KV Cache: Attention hesabını bellek dostu bloklara böler; vLLM'in PagedAttention'ı KV cache israfını yüzde 60-80 azaltır.
  • check_circle Gradient Checkpointing: Eğitimde aktivasyonları saklamak yerine geri yayılımda yeniden hesaplar; yaklaşık yüzde 30 hız karşılığında ciddi bellek kazanımı verir.
  • check_circle Tensor / Pipeline Parallelism: Modeli birden fazla GPU'ya böler; NVLink (H100'de 900 GB/s) kartlar arası aktarım darboğazını azaltır.
  • check_circle CPU / Disk Offload: Sığmayan katmanları RAM'e taşır; llama.cpp'nin katman bölüştürmesi yavaş ama çalışır bir son çaredir.

Birleşik Bellek: Apple Silicon ve Yeni Mimariler

Klasik PC mimarisinde VRAM ve sistem RAM'i ayrıdır; veriler PCIe üzerinden (5.0 x16'da ~64 GB/s) kopyalanır ve bu hat, HBM'in 3-8 TB/s hızının yanında dar bir boğazdır. Apple Silicon bu ayrımı kaldırır: M serisi çiplerde CPU ve GPU tek bellek havuzunu paylaşır. M4 Max 128 GB'a kadar, M3 Ultra 512 GB'a kadar birleşik bellek sunar ve 800 GB/s'yi aşan bant genişliğiyle 70B-120B sınıfı modelleri tek makinede çalıştırır; 4-bit kuantize DeepSeek R1 671B'nin M3 Ultra üzerinde koşturulması bu mimarinin simge örneğidir. NVIDIA da aynı yöne ilerliyor: Grace Hopper ve GB200 süper çiplerinde CPU-GPU belleği NVLink-C2C ile 900 GB/s hızında birleşirken, 2025'te çıkan DGX Spark (GB10) 128 GB birleşik bellekli kompakt bir yerel AI istasyonu sunar. Birleşik belleğin bedeli ham GPU gücüdür: aynı modelde token üretim hızı genelde ayrık VRAM'li üst düzey NVIDIA kartların gerisinde kalır, ancak kapasite/fiyat oranı büyük modeller için çekicidir.

Hangi İş İçin Kaç GB VRAM? Pratik Seçim Rehberi

Kullanım amacına göre 2026 pratiği şöyle özetlenebilir. 8 GB: 7B-8B modeller INT4'te (Llama 3.1 8B, Qwen3 8B), SD 1.5 görüntü üretimi — giriş seviyesi. 12-16 GB: 13-14B INT4, SDXL ve FP8 Flux; RTX 4070 Ti Super / 5070 Ti sınıfı. 24 GB: yerel AI'ın tatlı noktası; 32B INT4 (Qwen3 32B, Gemma 3 27B), 13B FP16 ve 7B QLoRA ince ayarı. 32 GB (RTX 5090): 70B modellerin agresif kuantize sürümlerine yaklaşır, uzun bağlamda 32B'yi rahatlatır. 48-96 GB (RTX 6000 Ada, A6000, çift 4090): 70B INT4 çıkarımı ve QLoRA ince ayarı. 141-192 GB (H200, B200, MI300X): 70B FP16, 100B+ modeller ve ciddi eğitim işleri. Bulut kiralama saatlik 2-10 dolar bandındayken, günde birkaç saatlik kullanım için satın alma yerine kiralama çoğu zaman daha ekonomiktir. Kural: hedef modelin kuantize boyutu + bağlam için yüzde 20-30 pay = ihtiyacınız olan VRAM.

Sık Sorulan Sorular

  • check_circle VRAM nedir, ne işe yarar?: VRAM, GPU'nun üzerindeki yüksek hızlı bellektir. Oyunlarda dokuları ve kare tamponlarını, yapay zekada model ağırlıklarını ve KV cache'i tutar; kapasitesi hangi modelin çalışabileceğini belirler.
  • check_circle VRAM ile RAM arasındaki fark nedir?: RAM CPU'ya, VRAM GPU'ya hizmet eder. VRAM'in bant genişliği çok daha yüksektir (GDDR7 ~1,8 TB/s, HBM3e ~8 TB/s; DDR5 ~64-100 GB/s) ama kapasitesi genelde daha düşüktür.
  • check_circle Yapay zeka için kaç GB VRAM gerekir?: 7-8B model INT4 için 6-8 GB, 13B için 10-12 GB, 32B için 20-24 GB, 70B için 35-48 GB gerekir. FP16 çalıştırmak bu değerleri yaklaşık 4 kat büyütür.
  • check_circle VRAM yetmezse ne yapılır?: Sırasıyla denenir: 4-bit kuantizasyon (GGUF/AWQ), daha küçük model, bağlam penceresini kısaltma, CPU offload veya çoklu GPU. İnce ayar için QLoRA + gradient checkpointing kullanılır.
  • check_circle Ekran kartının VRAM'i artırılabilir mi?: Hayır; VRAM yongaları karta lehimlidir ve son kullanıcı tarafından yükseltilemez. Daha fazla bellek için yeni kart, ikinci GPU veya birleşik bellekli sistem (Mac, DGX Spark) gerekir.
  • check_circle Apple'ın birleşik belleği VRAM yerine geçer mi?: Evet, kapasite açısından geçer: M serisi çiplerde GPU tüm birleşik belleğe erişir ve 512 GB'a kadar model yüklenebilir. Ancak token üretim hızı genelde eşdeğer NVIDIA kartların altındadır.