Tensor Core (Tensor Çekirdeği)

Tensor Core, NVIDIA GPU'larında matris çarpma-biriktirme (MMA) işlemlerini hızlandıran özel donanım birimidir.

Tensor Core, NVIDIA'nın 2017'de Volta mimarisiyle (V100) tanıttığı, matris çarpma-biriktirme (Matrix Multiply-Accumulate, MMA: D = A × B + C) işlemini tek saat döngüsünde gerçekleştiren özel donanım birimidir. Derin öğrenme modellerinin hem eğitimi hem çıkarımı dev matris çarpmalarından oluştuğu için bu birimler, modern yapay zekâ hesaplamasının fiili motoru konumundadır. Klasik CUDA çekirdekleri genel amaçlı skaler ve vektör işlemler için tasarlanmıştır; Tensor Core ise sabit işlevli bir matris motorudur. Bir warp (32 iş parçacığı), `wmma` API'si üzerinden 16×16 matrisleri 4×4 bloklara bölerek işler ve aynı hassasiyetteki FP32 CUDA hesabına kıyasla teorik tepe verimini kata katlar: FP16 modunda yaklaşık 8×, düşük bitli formatlarda çok daha fazlası. En kritik yetenek karma hassasiyettir (mixed precision): çarpma FP16, BF16 veya FP8 gibi kısa formatlarda yapılırken biriktirme FP32'de tutulur. Böylece bellek bant genişliği ihtiyacı yarıya iner, model doğruluğu büyük ölçüde korunur. PyTorch'ta `torch.autocast`, TensorFlow'da `tf.keras.mixed_precision` bu donanımı şeffaf biçimde devreye alır; cuBLAS, cuDNN ve TensorRT kütüphaneleri de arka planda Tensor Core kullanır. Nesil gelişimi hızlıdır: Volta FP16 ile başladı, Turing (2018) INT8/INT4 ekledi, Ampere (A100, 2020) TF32, BF16 ve 2:4 yapısal seyreklik getirdi, Hopper (H100, 2022) FP8 ve Transformer Engine ile LLM eğitiminin standardı oldu. Blackwell (B200/GB200, 2024) 5. nesil Tensor Core'larda FP4 ve FP6 formatlarını, 2. nesil Transformer Engine'i ve mikro ölçekleme (MX) veri tiplerini tanıttı; B200 tek başına FP4'te 9 PFLOPS'u aşan yoğun matris verimi sunar. 2026 itibarıyla GPT, Claude, Gemini ve Llama sınıfı modellerin eğitimi on binlerce Blackwell GPU'luk kümelerde, çıkarımı ise FP8/FP4 nicemlemeyle Tensor Core'lar üzerinde koşar; NVIDIA'nın Rubin mimarisi de 2026 yol haritasında aynı çizgiyi sürdürür.

Tensor Core Nasıl Çalışır?

NVIDIA GPU'ları iki farklı hesaplama birimi barındırır: genel amaçlı CUDA çekirdekleri ve matrise özel Tensor Core'lar. CUDA çekirdeği döngü, koşul ve tekil aritmetik işler; Tensor Core ise yalnızca D = A × B + C biçimindeki matris çarpma-biriktirme operasyonunu yürüten sabit işlevli bir birimdir. Temel prensip, her saat döngüsünde 4×4 boyutunda bir matris çarpımını tamamlamaktır. Bir warp (32 iş parçacığı), `wmma` (warp-level matrix multiply-accumulate) API'si ile 16×16 matris parçalarını (fragment) bu 4×4 bloklara dağıtır; Hopper ve Blackwell'de `wgmma` komutlarıyla warp grubu düzeyinde daha büyük döşemeler asenkron işlenir. Geliştirici için üç erişim yolu vardır: doğrudan `wmma`/`wgmma` ile kernel yazmak, CUTLASS şablon kütüphanesini kullanmak ya da cuBLAS/cuDNN/TensorRT gibi hazır kütüphanelere yaslanmak. PyTorch'ta `torch.autocast(device_type='cuda')` bloğu, TensorFlow'da `mixed_precision.set_global_policy('mixed_float16')` çağrısı yeterlidir; matris boyutlarının 8'in (FP16) veya 16'nın (INT8/FP8) katı olması Tensor Core kullanım oranını yükseltir.

Nesil Gelişimi: Volta'dan Blackwell'e

volta 1. Nesil — Volta (V100, 2017)

İlk Tensor Core nesli: FP16 çarpma, FP32 biriktirme. V100'de 640 Tensor Core ile yaklaşık 125 TFLOPS FP16 tepe performansı; yalnızca veri merkezi GPU'larında yer aldı.

turing 2. Nesil — Turing (T4, RTX 20, 2018)

INT8 ve INT4 ile çıkarım hızlandırma; Tensor Core ilk kez tüketici RTX kartlarına indi. DLSS 1.0 bu nesille çalıştı.

ampere 3. Nesil — Ampere (A100, RTX 30, 2020)

TF32, BF16 ve 2:4 yapısal seyreklik. A100: 156 TFLOPS TF32, 312 TFLOPS BF16 (2:4 seyreklikle iki katı). GPT-3 sonrası LLM dalgasının eğitim platformu.

hopper 4. Nesil — Hopper (H100/H200, 2022)

FP8 ve Transformer Engine: H100 FP8'de 1.979 TFLOPS'a (seyreklikle 3.958) ulaşır, A100'e göre 6 kata varan verim. H200 aynı çekirdeği 141 GB HBM3e ile eşler.

blackwell 5. Nesil — Blackwell (B200/GB200, RTX 50, 2024-25)

FP4 ve FP6 mikro ölçekleme (MXFP) formatları, 2. nesil Transformer Engine. B200 FP4'te 9 PFLOPS'u aşar; GB200 NVL72 rafı 72 GPU'yu tek NVLink alanında birleştirir. RTX 50 serisi ve DLSS 4 aynı nesli kullanır.

Karma Hassasiyet ve Düşük Bitli Formatlar

Tensor Core'un asıl kazancı karma hassasiyettir: çarpma FP16/BF16/FP8 gibi kısa formatlarda yapılır, biriktirme ve ağırlık güncellemesi FP32'de kalır. Kısa format bellek trafiğini yarıya indirir, matris motoru da aynı silikon alanında kat kat fazla işlem sığdırır; doğruluk kaybı çoğu modelde yüzde 1'in altında kalır. BF16, FP16 ile aynı 16 biti kullanır ama üs alanı FP32 ile aynıdır (8 bit); taşma riski düşük olduğu için LLM eğitiminde varsayılan tercih haline geldi. TF32, FP32 kodunu değiştirmeden 19 bitlik iç formatla Tensor Core'a yönlendiren Ampere buluşudur. FP8 (E4M3/E5M2) Hopper'la, FP4/FP6 ise Blackwell'le geldi. Transformer Engine, katman bazında ölçekleme faktörlerini dinamik ayarlayıp hangi katmanın hangi formatta güvenle çalışacağına karar verir; DeepSeek-V3'ün FP8 ile eğitilmesi bu yaklaşımın büyük ölçekte kanıtı oldu. 2026'da FP4 nicemleme, üretim çıkarımında maliyeti token başına yarıdan fazla düşüren standart tekniklerden biridir.

Uygulama Alanları

  • check_circle Büyük Dil Modeli Eğitimi: GPT, Claude, Gemini ve Llama sınıfı modellerin ileri/geri yayılımındaki dev matris çarpmaları Tensor Core'larda koşar; on binlerce H100/B200'lük kümeler aylık eğitimleri haftalara indirir.
  • check_circle LLM Çıkarımı: TensorRT-LLM ve vLLM, ağırlıkları FP8/FP4'e nicemleyip Tensor Core'da çalıştırır; aynı donanımda saniye başına token verimi 2-4 kat artar.
  • check_circle Oyun Grafiği (DLSS 4): DLSS'in transformer tabanlı süper çözünürlük ve kare üretimi modelleri RTX kartlardaki Tensor Core'larda gerçek zamanlı çalışır; 4K'da kare hızını katlar.
  • check_circle Bilimsel Hesaplama (HPC): Moleküler dinamik, iklim simülasyonu ve FourCastNet gibi yapay zekâ destekli hava tahmini, karma hassasiyetli Tensor Core matematiğinden doğrudan yararlanır.
  • check_circle Uçta Yapay Zekâ: Jetson Orin ve Thor modülleri, robotik ve otonom araçlarda INT8/FP8 Tensor Core çıkarımıyla düşük güçte yüksek TOPS sunar.

Tensor Core, TPU ve Rakip Matris Motorları

Matrise özel donanım fikri yalnızca NVIDIA'ya ait değildir. Google TPU'ları sistolik dizi (systolic array) mimarisiyle aynı MMA işini yapar; TPU v5p ve Trillium (v6e) Gemini modellerinin eğitim altyapısıdır. AMD, CDNA mimarisindeki Matrix Core'larla (MI300X, MI355X) FP8 ve FP4 destekli rekabet sunar; Intel Gaudi 3 ve Apple'ın Neural Engine'i de kendi matris birimlerini taşır. NVIDIA'yı öne çıkaran donanımdan çok yazılım katmanıdır: CUDA, cuDNN, CUTLASS ve TensorRT ekosistemi 15 yılı aşkın birikime dayanır; PyTorch'un varsayılan hızlı yolu Tensor Core'a göre ayarlanmıştır. Pratik fark seçim kriterlerine yansır: bulutta esneklik ve ekosistem arayan ekipler NVIDIA GPU kiralar, Google Cloud'a bağlı büyük eğitim işleri TPU pod'larını tercih edebilir, maliyet odaklı çıkarım için AMD MI300X'in 192 GB HBM3'ü cazip bir alternatiftir. 2026'da üç platform da FP8'i standart, FP4'ü yeni cephe olarak konumlandırıyor.

Performansı Artırma İpuçları

  • check_circle Boyutları hizalayın: Matris boyutlarını FP16 için 8'in, INT8/FP8 için 16'nın katı seçin; aksi halde işlem Tensor Core yerine CUDA çekirdeklerine düşebilir.
  • check_circle AMP kullanın: PyTorch'ta `torch.autocast` + `GradScaler` ikilisi kod değişikliği olmadan 2-3 kat eğitim hızlanması getirir.
  • check_circle TF32'yi açık tutun: `torch.backends.cuda.matmul.allow_tf32 = True` ile FP32 kodu bile Ampere ve sonrasında Tensor Core'da koşar.
  • check_circle Kullanımı ölçün: Nsight Compute'ta 'Tensor Pipe Utilization' metriği veya DCGM ile Tensor Core doluluk oranını izleyin; yüzde 40'ın altı genellikle veri besleme darboğazına işaret eder.
  • check_circle Nicemlemeyi değerlendirin: Çıkarımda TensorRT-LLM ile FP8/FP4 nicemleme, doğruluğu koruyup gecikmeyi belirgin düşürür.

Sık Sorulan Sorular

  • check_circle Tensor Core ile CUDA Core arasındaki fark nedir?: CUDA Core her türlü skaler/vektör işlemi yapabilen genel amaçlı birimdir; Tensor Core yalnızca matris çarpma-biriktirme yapar ama bu işte FP16'da yaklaşık 8 kat, FP8/FP4'te çok daha yüksek verim sunar. İkisi aynı GPU'da birlikte çalışır.
  • check_circle Tensor Core'u nasıl etkinleştiririm?: PyTorch'ta `torch.autocast(device_type='cuda')` bloğu, TensorFlow'da `tf.keras.mixed_precision.set_global_policy('mixed_float16')` çağrısı yeterlidir; uygun operasyonlar otomatik olarak Tensor Core'a yönlenir. cuBLAS/cuDNN kullanan her kütüphane bunu zaten yapar.
  • check_circle Hangi NVIDIA GPU'larda Tensor Core bulunur?: Veri merkezinde V100, T4, A100, H100/H200 ve B200/GB200; tüketici tarafında RTX 20, 30, 40 ve 50 serilerinin tamamında bulunur. GTX serisi ile Pascal ve öncesi mimarilerde yoktur.
  • check_circle FP8 ve FP4 nedir, neden önemlidir?: FP8 (Hopper, 2022) ve FP4 (Blackwell, 2024) düşük bitli kayan nokta formatlarıdır. Her bit yarılanması bellek ihtiyacını yarıya indirip işlem hızını yaklaşık ikiye katlar; Transformer Engine ölçekleme faktörlerini katman bazında ayarlayarak doğruluk kaybını sınırlar. DeepSeek-V3, FP8 eğitiminin büyük ölçekte çalıştığını gösterdi.
  • check_circle Tensor Core ile TPU aynı şey mi?: Hayır. İkisi de matris çarpımını hızlandırır ama Tensor Core, NVIDIA GPU'su içindeki bir alt birimdir; TPU ise Google'ın yalnızca bu iş için tasarladığı ayrı bir çiptir (ASIC). GPU genel amaçlı esneklik sunar, TPU tek işte yoğunlaşır.
  • check_circle Oyun için Tensor Core gerekli mi?: DLSS 4'ün süper çözünürlük ve çoklu kare üretimi özellikleri Tensor Core ister; bu yüzden yalnızca RTX serisi kartlarda çalışır. DLSS kullanmayan oyunlarda kare hızına doğrudan katkısı yoktur.