GPU (Graphics Processing Unit) (Grafik İşlemci (Ekran Kartı))

Binlerce kucuk paralel cekirdekle matris ve tensor islemlerini hizlandiran, derin ogrenme egitimi icin standart donanim.

GPU (Graphics Processing Unit — Grafik İşleme Birimi), başlangıçta bilgisayar grafiklerini hesaplamak için tasarlanmış; fakat binlerce küçük çekirdekli paralel mimarisi ile yapay zeka ve yüksek performanslı hesaplama (HPC) alanında vazgeçilmez hale gelmiş bir işlemci türüdür. Günümüzde derin öğrenme eğitimi ve çıkarsama işlemlerinin büyük çoğunluğu GPU üzerinde gerçekleşmektedir. GPU'ların paralel mimarisi, AI hesaplamalarında kritik öneme sahip matris çarpma ve tensor işlemlerine çok iyi uymaktadır. NVIDIA'nın CUDA (Compute Unified Device Architecture) platformu, geliştiricilere GPU üzerinde genel amaçlı hesaplama yapmayı mümkün kılan ilk geniş kapsamlı yazılım katmanıydı. 2007'de tanıtılan CUDA, bugün de derin öğrenme ekosisteminin temelini oluşturmaktadır. NVIDIA'nın AI odaklı GPU'ları GPU mimarisinin evrimini yönlendirmiştir: Tesla (2008), Kepler, Maxwell, Pascal, Volta, Ampere ve son olarak Hopper mimarisi (H100). A100 ve H100, LLM eğitiminde standart haline gelmiştir. AMD ise ROCm platformu ve MI300X çipleriyle bu pazara rakip olarak girmektedir. Apple'ın M serisi çipler ise birleşik bellek mimarisiyle AI çıkarsama için enerji verimli alternatif sunmaktadır. Derin öğrenme çerçeveleri (TensorFlow, PyTorch) GPU desteğini neredeyse tamamen CUDA/cuDNN (NVIDIA) üzerinden sağlar. Tensor Core'lar, H100 gibi modern çipler üzerinde yarı hassas (FP16/BF16) matris işlemlerini 10-100 kat hızlandırır. GPU belleği (VRAM) model büyüklüğünü doğrudan sınırlar; 80GB VRAM'e sahip H100, 70 milyar parametreli bir modeli tam hassasiyetle tutabilir. Bulut GPU hizmetleri (AWS EC2 P4d, Google Cloud A100, Azure NDv4) on-premises donanım yatırımı yapmadan büyük ölçekli model eğitimi olanağı tanır. Multi-GPU konfigürasyonlarında NVLink ve InfiniBand bant genişliği, eğitim süresini doğrusal ölçekte kısaltmaktadır. GPU kapasitesi, modern yapay zeka sistemlerinin ölçeğini doğrudan belirleyen temel mühendislik kısıtlarından biri olmaya devam etmektedir. Enerji tüketimi ve soğutma maliyetleri de GPU seçimini etkileyen önemli faktörler arasındadır; H100 çipinin maksimum güç tüketimi 700W düzeyindedir.

CPU ve GPU Mimarisi Farkı

CPU, az sayıda güçlü çekirdek (4-128) ile karmaşık, sırasal görevleri verimli çalıştırır. GPU ise binlerce küçük çekirdek (H100: 16.896 CUDA çekirdeği) ile aynı işlemi büyük veri üzerinde paralel çalıştırır. Matris A x B hesaplamasında GPU, binlerce elemanı aynı anda hesaplayarak CPU'yu çok geride bırakır. Bu özellik, derin öğrenmedeki temel operasyonu (matris ve tensor) GPU'yu vazgeçilmez kılar.

CUDA Ekosistemi

CUDA, NVIDIA tarafından geliştirilmiş C++ uzantısıdır; GPU üzerinde paralel hesaplama için kernel fonksiyonlar yazmayı sağlar. cuDNN, sinir ağı primitive'lerini (konvolüsyon, aktivasyon, normalizasyon) GPU-optimize edilmiş olarak sağlar. NCCL, çok GPU'lu iletişim için kolektif işlemi destekler. TensorRT, eğitim sonrası derin öğrenme modelini çıkarsama için GPU-optimize olarak derleme aracıdır. Bu ekosistem NVIDIA'yı derin öğrenme alanında rekabetçi konumda tutmaktadır.

Tensor Core ve Yarı Hassas Hesaplama

Tensor Core'lar, FP16 veya BF16 formatıyla matris çarpmasını FP32'ye göre 10-100 kat daha hızlı gerçekleştirmek için tasarlanmış donanım birimleridir. Modern LLM eğitimi neredeyse tamamen BF16 veya FP8 ile yapılır; hassasiyet kaybı ihmal edilebilir, hız kazancı muazzam. H100 NVLink ile birçok GPU birbirine bağlanabilir ve kolektif iletişim 900 GB/s bant genişliği sağlar.

VRAM ve Model Büyüklüğü

Model parametreleri ve aktivasyonları GPU belleği (VRAM) kaplar. Bir parametrenin FP16 (2 bayt) ile saklandığını varsayarsak 7 milyar parametreli model yaklaşık 14 GB VRAM gerektirir. 70B model ~140 GB; bu da iki adet A100 80GB veya iki adet H100 80GB gerektirir. Model paralelliği ve tensor paralelliği ile büyük modeller çok GPU üzerine dağıtılabilir. Bu nedenle üretimde GPU sayısı doğrudan kapasite planlamasını belirler.

AI GPU Seçim Kılavuzu

Tüketici GPUları

RTX 4090 (24GB VRAM) ile 70B parametre modeli 4-bit'te çalıştırılabilir; maliyet etkin bireysel araştırma ve yerel LLM çıkarımı için tercih.

Profesyonel Sınıf

A6000 (48GB) ve A100 (80GB); büyük model eğitimi ve çıkarımı için; NVLink ile çoklu GPU birleştirme mümkün, ECC bellek güvenilirliği.

Veri Merkezi GPUları

H100 SXM (80GB HBM3) ve H200 (141GB HBM3e); LLM eğitimi için referans donanım, NVSwitch ile 256 GPU'ya kadar ölçeklenebilir.

Bulut GPU Kiralama

Lambda Labs, Vast.ai ve RunPod bireysel araştırmacılara uygun fiyatlı GPU erişimi; A100'de saatlik ~$2-3, kısa eğitim çalışmaları için idealdir.

Sıkça Sorulan Sorular

  • check_circle Hangi GPU derin öğrenme için iyi başlangıç? RTX 4080 veya RTX 3090 tüketici segmenti için uygun; araştırma için A100 veya H100. Bulut (Google Colab, AWS, Vast.ai) kiralama ile başlangıç yapılabilir.
  • check_circle AMD GPU'ları derin öğrenme için kullanılabilir mi? Evet; ROCm (PyTorch ve TensorFlow destekli); ancak CUDA kadar olgun ekosistem yoktur ve uyumsuzluklar zaman zaman yaşanır.
  • check_circle Apple M serisi GPU derin öğrenme için yeterli mi? Metal Performance Shaders üzerinden PyTorch destekli; ev ortamında hafif eğitim için kullanışlı. LLM çıkarsama için verimlidir ancak büyük eğitim için yetersiz kalır.
  • check_circle VRAM ne kadar yeterli? 8 GB küçük denemeler; 24 GB (RTX 4090) 7B fine-tuning; 80 GB 70B model çıkarsama için yeterlidir.