tag GPU

AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)

Bu sayfada GPU (AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)) etiketi ile işaretlenmiş 20 yapay zeka kavramını bulabilirsiniz.

AI Hızlandırıcı (İng. AI Accelerator), derin öğrenme ve makine öğrenimi iş yüklerini geleneksel merkezi işlem birimlerine (CPU) kıyasla çok daha verimli ve hızlı işlemek amacıyla geliştirilmiş özel amaçlı donanım birimleridir. Yapay zeka modellerinin eğitim ve çıkarım (inference) aşamalarında milyarlarca matris çarpımı, vektör toplama ve aktivasyon fonksiyonu hesabı gerçekleştirilir; bu işlemler genel amaçlı CPU mimarilerinde ciddi darboğazlar oluşturur. AI hızlandırıcılar, sinir ağı operasyonlarına doğrudan optimize edilmiş paralel işlem birimleri ve özel bellek mimarileriyle bu sorunu çözer. Bu alanda en yaygın kullanılan türler şunlardır: GPU (Grafik İşlem Birimi) — binlerce küçük çekirdeğiyle yüksek paralel işlem kapasitesi sunan ilk popüler AI hızlandırıcı; TPU (Tensör İşlem Birimi) — Google'ın TensorFlow iş yükleri için geliştirdiği özel ASIC; NPU (Sinirsel İşlem Birimi) — akıllı telefon ve IoT cihazlarına entegre, düşük güçte çıkarım yapan çip; FPGA (Sahaya Programlanabilir Kapı Dizisi) — yeniden yapılandırılabilir mimarisiyle esnek optimizasyon imkânı sunan donanım; ASIC (Uygulamaya Özel Entegre Devre) — tek bir iş yükü için tasarlanmış, en yüksek verimlilik oranına ulaşan çip. Hızlandırıcıların performansı; saniyede gerçekleştirilebilen kayan noktalı işlem sayısı (TFLOPS), yüksek bant genişlikli bellek (HBM) kapasitesi, bellek bant genişliği ve chip-to-chip iletişim hızı (NVLink, InfiniBand) gibi metriklerle ölçülür. Enerji verimliliği FLOPS/Watt biriminde ifade edilir ve veri merkezi işletme maliyetlerini doğrudan etkiler. Büyük dil modelleri (LLM) trilyonlarca parametreye ulaştıkça yüzlerce ila binlerce hızlandırıcının NVLink veya InfiniBand ile birbirine bağlandığı kümeler (accelerator clusters) ortaya çıkmıştır. NVIDIA H100/H200 Hopper ve Blackwell serileri, Google Trillium (TPU v6), AWS Trainium2 ve Groq LPU günümüz yapay zeka altyapısının bel kemiğini oluşturmaktadır. Öte yandan uç yapay zeka (edge AI) alanında NPU'lar akıllı telefon, güvenlik kamerası ve araç içi sistemlere gömülerek bulut bağlantısı gerektirmeden gerçek zamanlı çıkarım yapabilmektedir. Bu iki eğilim — bulut kümelerindeki devasa ölçek ve uçtaki düşük güçlü çıkarım — modern AI hızlandırıcı ekosisteminin iki kutbunu tanımlamaktadır.

developer_board

AI Hızlandırıcı (Yapay Zeka Hızlandırıcısı)

AI Hızlandırıcı (İng. AI Accelerator), derin öğrenme ve makine öğrenimi iş yüklerini geleneksel merkezi işlem birimlerine (CPU) kıyasla çok daha verimli ve hızlı işlemek amacıyla geliştirilmiş özel amaçlı donanım birimleridir. Yapay zeka modellerinin eğitim ve çıkarım (inference) aşamalarında milyarlarca matris çarpımı, vektör toplama ve aktivasyon fonksiyonu hesabı gerçekleştirilir; bu işlemler genel amaçlı CPU mimarilerinde ciddi darboğazlar oluşturur. AI hızlandırıcılar, sinir ağı operasyonlarına doğrudan optimize edilmiş paralel işlem birimleri ve özel bellek mimarileriyle bu sorunu çözer. Bu alanda en yaygın kullanılan türler şunlardır: GPU (Grafik İşlem Birimi) — binlerce küçük çekirdeğiyle yüksek paralel işlem kapasitesi sunan ilk popüler AI hızlandırıcı; TPU (Tensör İşlem Birimi) — Google'ın TensorFlow iş yükleri için geliştirdiği özel ASIC; NPU (Sinirsel İşlem Birimi) — akıllı telefon ve IoT cihazlarına entegre, düşük güçte çıkarım yapan çip; FPGA (Sahaya Programlanabilir Kapı Dizisi) — yeniden yapılandırılabilir mimarisiyle esnek optimizasyon imkânı sunan donanım; ASIC (Uygulamaya Özel Entegre Devre) — tek bir iş yükü için tasarlanmış, en yüksek verimlilik oranına ulaşan çip. Hızlandırıcıların performansı; saniyede gerçekleştirilebilen kayan noktalı işlem sayısı (TFLOPS), yüksek bant genişlikli bellek (HBM) kapasitesi, bellek bant genişliği ve chip-to-chip iletişim hızı (NVLink, InfiniBand) gibi metriklerle ölçülür. Enerji verimliliği FLOPS/Watt biriminde ifade edilir ve veri merkezi işletme maliyetlerini doğrudan etkiler. Büyük dil modelleri (LLM) trilyonlarca parametreye ulaştıkça yüzlerce ila binlerce hızlandırıcının NVLink veya InfiniBand ile birbirine bağlandığı kümeler (accelerator clusters) ortaya çıkmıştır. NVIDIA H100/H200 Hopper ve Blackwell serileri, Google Trillium (TPU v6), AWS Trainium2 ve Groq LPU günümüz yapay zeka altyapısının bel kemiğini oluşturmaktadır. Öte yandan uç yapay zeka (edge AI) alanında NPU'lar akıllı telefon, güvenlik kamerası ve araç içi sistemlere gömülerek bulut bağlantısı gerektirmeden gerçek zamanlı çıkarım yapabilmektedir. Bu iki eğilim — bulut kümelerindeki devasa ölçek ve uçtaki düşük güçlü çıkarım — modern AI hızlandırıcı ekosisteminin iki kutbunu tanımlamaktadır.

arrow_forward
code_blocks

Blackwell (NVIDIA Blackwell GPU Mimarisi)

Blackwell, NVIDIA tarafından Mart 2024'te duyurulan beşinci nesil GPU mimarisidir ve yapay zeka altyapısında çığır açan bir ilerlemeyi temsil eder. İsmi, olasılık teorisi ve istatistiğe katkılarıyla tanınan Afrikalı-Amerikalı matematikçi ve akademisyen David Blackwell'den almaktadır. Mimari, TSMC'nin gelişmiş 4NP üretim süreci üzerine inşa edilmiş çift-die (dual-die) chiplet tasarımı kullanır ve toplamda 208 milyar transistör içerir; bu rakam selefinin (Hopper/H100) neredeyse iki katıdır. Blackwell ailesi birden fazla GPU çeşidini kapsar: B100 giriş seviyesi varyant, B200 amiral gemisi GPU ve GB200 Grace-Blackwell Süperçip modülü. Bellek kapasitesi açısından B200, 192 GB HBM3e belleğe ve 8 TB/s bellek bant genişliğine sahiptir. Blackwell Ultra serisiyle birlikte gelen B300 modeli ise bu değeri 288 GB HBM3e'ye çıkarmıştır. GB200 NVL72 raf sistemi, 72 adet B200 GPU ile 36 adet Grace CPU'yu tek bir sıvı soğutmalı rafta birleştirerek toplamda 13,5 TB HBM3e bellek kapasitesi ve 1,4 eksaFLOPS hesaplama gücü sunar. Beşinci nesil NVLink (NVLink 5.0), her GPU için 1,8 TB/s çift yönlü bant genişliği sağlayarak Hopper'daki NVLink 4'e göre bant genişliğini ikiye katlar. Çift-die mimarisinin iç bağlantısında ise 10 TB/s bant genişliği elde edilmektedir; bu sayede iki die arasındaki veri transferi neredeyse engelsiz gerçekleşir. Blackwell'in en dikkat çekici yeniliği FP4 ve FP6 hassasiyet formatları ile mikro-tensör ölçeklendirme teknolojisidir. FP4 formatında 20 petaFLOPS hesaplama gücü sunan mimari, model ağırlıklarının bellek gereksinimini yarıya indirerek trilyon parametreli modellerin eğitimini ve çıkarımını daha önce mümkün olmayan ölçeklerde gerçekleştirmeye olanak tanır. Performans karşılaştırmalarında Blackwell, Hopper (H100) mimarisine göre çarpıcı üstünlükler sergiler: Llama 2 70B ince ayarında 2,2 kat, GPT-3 175B ön eğitiminde ise 2 kat hız artışı sağlar. GB200 NVL72 raf sistemi, büyük ölçekli LLM çıkarım görevlerinde H100'e kıyasla 30 kat performans iyileştirmesi sunarken enerji tüketimini 25 kat azaltır. Önceden 256 Hopper GPU gerektiren iş yükleri artık yalnızca 64 Blackwell GPU ile yürütülebilmektedir. Google, Meta, Microsoft ve Amazon gibi hiper ölçekli şirketler büyük yapay zeka modellerinin eğitimi ve çıkarım altyapısı için Blackwell'i benimsemiştir. NVIDIA bu teknolojiyi yapay zeka fabrikaları olarak konumlandırmakta ve trilyon parametreli modellerin ticari ölçekte çalışmasını mümkün kılan hesaplama altyapısı olarak tanımlamaktadır.

arrow_forward
dynamic_feed

Continuous Batching (Sürekli Toplu İşlem)

Continuous Batching (Sürekli Toplu İşlem), LLM çıkarım sunucularında gelen istekleri statik batch'ler yerine sürekli, iterasyon bazlı dinamik gruplar hâlinde işleyen bir zamanlama tekniğidir. Geleneksel statik batching'de tüm istekler aynı uzunluğa tamamlanana kadar GPU boşta bekler; bu durum GPU kullanım oranını ciddi biçimde düşürür. Continuous batching ise her decoding adımında yeni isteklerin batch'e eklenmesine ve tamamlananların batch'ten çıkarılmasına olanak tanır. Tekniğin akademik temeli, Yu ve arkadaşlarının 2022'de yayımladığı "Orca: A Distributed Serving System for Transformer-Based Generative Models" çalışmasına dayanır. Bu makalede "iteration-level scheduling" adıyla tanımlanan yöntem, statik batch'e kıyasla 2-23× throughput artışı sağladığını kanıtladı. Pratik uygulamada ise 2023'te vLLM'nin PagedAttention ile birleştirdiği bu teknik, LLM servis altyapısında kalıcı bir standart hâline geldi. Teknik açıdan continuous batching; ön-doldurma (prefill) ve kod-çözme (decode) aşamalarının ayrılması, iterasyon düzeyinde zamanlama, verimli KV cache yönetimi ve öncelik kuyrukları bileşenlerine dayanır. Prefill aşamasında tüm prompt tokenleri bir kez işlenir; decode aşamasında her adımda tek token üretilir. Farklı isteklerin decode adımları eşzamanlı yürütüldüğünde GPU boşta kalmadan çalışmayı sürdürür; bu da KV cache alanının verimli kullanılmasını zorunlu kılar. Bellek yönetimi bu tekniğin kritik bir bileşenidir. PagedAttention, KV cache belleğini sanal sayfa tablosu modeline göre yönetir ve farklı uzunluktaki isteklerin yarattığı parçalanmayı önler. Çeşitli isteklerin KV state'leri aynı fiziksel GPU belleğinde örtüşmeden barındırılabilir; bu da sistemin eş zamanlı istek kapasitesini doğrudan artırır. Üretim ortamlarında continuous batching'i destekleyen başlıca framework'ler şunlardır: vLLM (PagedAttention ile), NVIDIA TensorRT-LLM, Hugging Face TGI (Text Generation Inference), SGLang (yapısal üretim için optimize) ve DeepSpeed-MII. GPU kapasitesi sabitken bu teknik, değişken uzunluktaki çok kullanıcılı API trafiğinde gecikme kararlılığını koruyarak saniyede işlenen token sayısını 10-20× artırabilmektedir. RAG pipeline'ları, ajansal AI sistemleri ve bulut LLM API'leri için temel bir altyapı bileşeni konumuna gelmiştir.

arrow_forward
memory

CUDA (Compute Unified Device Architecture)

CUDA (Compute Unified Device Architecture), NVIDIA tarafından 2006 yılında geliştirilen ve GPU'ları genel amaçlı hesaplama (GPGPU) için kullanmayı mümkün kılan paralel hesaplama platformu ve programlama modelidir. Grafik işleme birimlerinin binlerce çekirdeğini eş zamanlı olarak çalıştırma kapasitesini yapay zeka ve bilimsel hesaplamalar için açan bu teknoloji, modern derin öğrenmenin temel altyapısını oluşturur. CUDA, geleneksel CPU programlamadan temel bir paradigma değişikliği sunar. CPU'lar güçlü ancak sınırlı sayıda çekirdekle sıralı işlemler için optimize edilmişken; NVIDIA GPU'ları onlarca binden yüz binlerce CUDA çekirdeğiyle aynı anda binlerce işlem gerçekleştirebilir. Bu eşzamanlılık, matris çarpımı, konvolüsyon ve gradyan hesaplama gibi derin öğrenme operasyonlarını CPU'ya kıyasla 10–100 kat hızlandırır. CUDA'nın iş parçacığı hiyerarşisi üç katmandan oluşur: Temel birim olan iş parçacıkları (threads), bu iş parçacıklarını gruplandıran bloklar (blocks) ve blokları organize eden ızgaralar (grids). Bir CUDA çekirdeği (kernel) çağrıldığında GPU'da binlerce iş parçacığı eş zamanlı olarak çalışır; her blok içindeki iş parçacıkları paylaşılan belleği (shared memory) kullanarak birbirleriyle iletişim kurabilir. CUDA'nın bellek hiyerarşisi de performans açısından kritik rol oynar. Global bellek geniş kapasiteli (~80 GB/s bant genişliği) ancak yüksek gecikmeli; paylaşılan bellek ise blok başına ~100 KB kapasitesiyle SRAM hızında (~8 TB/s) çalışır. Verimli CUDA kodu, veri hareketini minimize ederek paylaşılan belleği akıllıca kullanır. Kaydediciler (registers), sabit bellek (constant memory) ve doku belleği (texture memory) ise erişim desenlerine göre optimize edilmiş ek bellek katmanları sunar. CUDA Toolkit, geliştiricilere nvcc derleyicisi, cuBLAS (lineer cebir), cuDNN (derin sinir ağları), cuFFT (Fourier dönüşümü) ve NCCL (çoklu GPU iletişimi) gibi optimize kütüphaneler sunar. Günümüzde FlashAttention ve TensorRT-LLM gibi araçlar CUDA kernellerini büyük dil modellerinin çıkarım aşaması için özelleştirerek LLM hızını 2–4 kat artırmaktadır. NVIDIA H100 gibi gelişmiş veri merkezi GPU'ları 16.896 CUDA çekirdeğine ek olarak FP16/BF16/INT8 matris işlemlerini 4–16 kat hızlandıran Tensor Core'lar içerir.

arrow_forward
bolt

Flash Attention (Flash Attention)

Flash Attention, Transformer modellerinin dikkat mekanizmasını GPU yüksek bant genişliği belleğine (HBM - High Bandwidth Memory) erişimleri en aza indirecek şekilde yeniden düzenleyen IO-bilinçli bir hesaplama yöntemidir. Standart dikkat algoritmasının O(n²) bellek karmaşıklığı yerine O(n) bellek kullanımı sağlar; bu fark özellikle uzun bağlam pencerelerinde dramatik bir verimlilik artışı anlamına gelir. Standart dikkat hesaplamasında Q, K, V (sorgu, anahtar, değer) matrislerinin tam NxN boyutundaki dikkat matrisi GPU HBM'e yazılır ve tekrar okunur. N token sayısı arttıkça bu matris için gereken bellek ve HBM erişim sayısı karesiyle büyür; bu hem yavaş hem bellek yoğun bir yaklaşımdır. Flash Attention'ın çözümü tiling (karo) tekniğidir. Giriş matrisleri küçük bloklara (tile) ayrılan bu yaklaşımda her blok GPU'nun hızlı SRAM ön belleğine yüklenir ve dikkat hesaplaması orada tamamlanır. SRAM HBM'den çok daha hızlı ve daha küçük; Flash Attention, HBM yazma/okuma sayısını agresif şekilde azaltarak hesaplamanın belleğe bağlı (memory-bound) darboğazını ortadan kaldırır. Yeniden hesaplama (recomputation) tekniği geri yayılım sırasındaki bellek ihtiyacını yönetir. İleri geçişte ara sonuçlar kaydedilmez; geri yayılım sırasında gerektiğinde yeniden hesaplanır. Bu, bellek tasarrufunu sağlarken ekstra hesaplama maliyeti getirir; ancak bu denge çok küçük bir maliyet olarak kalmaktadır. Tri Dao ve ekibi tarafından geliştirilmiş olan FlashAttention-1 2022'de yayımlanmış; FlashAttention-2 daha iyi iş bölümü ve paralelleştirme ile belirgin hızlanma sağlamıştır. FlashAttention-3, NVIDIA Hopper mimarisinin asenkron boru hatlarını ve FP8 desteğiyle daha da yüksek verimlilik sunmaktadır. PyTorch'un scaled_dot_product_attention API'si Flash Attention'ı varsayılan uygulama olarak entegre etmiştir; bu nedenle günümüzde çok sayıda Transformer uygulaması Flash Attention'dan dolayı, bunu fark etmeden yararlanmaktadır. **Sık Sorulan Sorular** **Flash Attention kullanmak için ne yapmam gerekir?** PyTorch >= 2.0'da torch.nn.functional.scaled_dot_product_attention kullanan herhangi bir model Flash Attention'dan otomatik olarak yararlanır. flash-attn paketini kurarak HuggingFace Transformers ve diğer çerçevedeki modellere Flash Attention 2/3 entegre edilebilir. **Flash Attention hangi GPU'larda çalışır?** FlashAttention-2 NVIDIA Ampere (A100) ve Hopper (H100) GPU'larında en iyi performansı gösterir; RTX serisi tüketici GPU'larında da çalışır. FlashAttention-3 Hopper mimarisine özelleştirilmiştir. **Flash Attention çıktıyı değiştirir mi?** Hayır. Flash Attention standart dikkat ile matematiksel olarak aynı sonucu üretir; fark yalnızca hesaplama verimliliğindedir. **Uzun bağlam neden Flash Attention olmadan bu kadar zorlayıcıdır?** 128K token için standart dikkat n²=16.4 milyar eleman boyutunda bir matris gerektirir; bu GPU belleğini tamamen aşabilir. Flash Attention bu sorunu tiling ile çözerek pratik uzun bağlam işlemesini mümkün kılar.

arrow_forward
code_blocks

Google Colab (Google Colaboratory)

Google Colaboratory (kısaca Colab), Google tarafından geliştirilen, tarayıcı üzerinden erişilebilen ücretsiz bir bulut Jupyter Notebook platformudur. Herhangi bir yerel kurulum gerektirmeksizin Python tabanlı makine öğrenimi ve yapay zeka projeleri geliştirmeye imkân tanır; NVIDIA GPU ve Google TPU kaynaklarına ücretsiz planda sınırlı, ücretli planlarda ise öncelikli biçimde erişim sunar. Colab'ın teknik temeli Jupyter Notebook protokolüne dayanır; kod hücreleri ve zengin metin hücreleri karma bir belgede bir arada bulunabilir. Notebook'lar otomatik olarak Google Drive'a .ipynb formatında kaydedilir. Gerçek zamanlı ortak düzenleme, paylaşım bağlantısı ve GitHub entegrasyonu ile Colab, hem eğitim hem araştırma süreçlerinde işbirliğini kolaylaştırır. TensorFlow, PyTorch, Keras, NumPy, pandas ve Matplotlib gibi makine öğrenimi kütüphaneleri önceden yüklü olarak gelir. Ücretsiz planda erişilebilen NVIDIA T4 GPU, temel derin öğrenme deneyleri için yeterli kapasiteyi sunar; ancak oturum süresi yaklaşık 12 saatle sınırlıdır ve bağlantı kesildiğinde çalışma ortamı sıfırlanır. Colab Pro (~10 $/ay) planı V100 ve A100 GPU'lara öncelikli erişim, uzun oturum süreleri ve 100 GB Drive depolama alanı sunar. Colab Pro+ (~50 $/ay) planı arka planda çalıştırma (background execution), 2 TB Drive depolama ve terminal erişimi gibi gelişmiş özellikler içerir. Platformun en yaygın kullanım alanları arasında öğrencilerin derin öğrenme modellerini eğitmesi, Kaggle yarışmacılarının veri analizi ve model geliştirme süreci, büyük dil modellerinin ince ayarı (fine-tuning), Stable Diffusion ile görüntü üretimi ve ses işleme projeleri yer almaktadır. Google'ın kendi araştırma demoları çoğunlukla Colab notebook'ları olarak yayımlanır; bu durum platformu yapay zeka topluluğunun fiilen kullandığı bir referans ortama dönüştürmektedir. Temel kısıtlamalar şunlardır: GPU kotasının yoğun kullanımda dolması, internet bağlantısı zorunluluğu, büyük veri kümeleriyle çalışmada Drive depolama sınırlamaları ve uzun eğitim süreçlerinde oturum zaman aşımı riski. Bu kısıtlamaları aşmak isteyen kullanıcılar genellikle ücretli planları veya alternatif bulut platformlarını tercih etmektedir.

arrow_forward
code_blocks

HBM (Yüksek Bant Genişlikli Bellek) (HBM (Yüksek Bant Genişlikli Bellek))

HBM (High Bandwidth Memory — Yüksek Bant Genişlikli Bellek), birden fazla DRAM yongasını dikey olarak üst üste yığan (3D stacking) ve bunları Through-Silicon Via (TSV) bağlantılarıyla birleştiren özel bir bellek mimarisidir. GDDR6 gibi geleneksel grafik belleklerinin bant genişliği sınırlarını aşmak amacıyla geliştirilmiş olan HBM, büyük dil modeli eğitimi ve çıkarımı gibi veri yoğun AI iş yüklerinde kritik bir rol oynamaktadır. HBM'nin temel yeniliği, birden fazla DRAM yongasını bir silikon ara katman (silicon interposer) üzerinde yan yana konumlandırmak ve her yığını TSV adı verilen dikey bakır bağlantılarla birbirine bağlamaktır. Bu yapı 1024 bit veya daha geniş bellek arayüzü oluşturarak GDDR6'nın 384 bitlik sınırını çok aşar. Yüksek arayüz genişliği düşük saat hızıyla birleşince hem yüksek bant genişliği hem de düşük güç tüketimi elde edilir; GDDR6'ya kıyasla yaklaşık yüzde 65 daha az enerji harcanır. HBM mimarisi 2013'ten bu yana hızla gelişmiştir. İlk nesil HBM 128 GB/s bant genişliği sunarken 2016'da gelen HBM2 bunu 256 GB/s'ye çıkardı. NVIDIA A100'de kullanılan HBM2E 410 GB/s ile transformer modellerinin ilk yaygınlaşma döneminin referans donanımı oldu. NVIDIA H100'de kullanılan HBM3 ise 3,35 TB/s bant genişliğiyle büyük dil modellerinin bellek darboğazını büyük ölçüde çözdü. HBM3E, H200 ve GB200 GPU'larında 4,8 TB/s bant genişliğiyle uzun bağlam pencereli modellerin çıkarımını kolaylaştırmaktadır. JEDEC'in Nisan 2025'te yayımladığı HBM4 spesifikasyonu 2048 bitlik arayüz ve yığın başına 2 TB/s bant genişliği vaat etmektedir. HBM arzı, AI donanım ekosistemi için stratejik bir kırılganlık noktası oluşturmaktadır. Pazar yalnızca üç tedarikçinin kontrolündedir: SK Hynix yüzde 62, Micron yüzde 21 ve Samsung yüzde 17 paya sahiptir. CoWoS ve diğer gelişmiş paketleme teknolojileri, HBM yığınlarını GPU dieleriyle yakın fiziksel konumda bir araya getirerek gecikmeyi azaltmaktadır. Tedarik kıtlığı, H100 üretim hızının temel sınırlayıcısı olmuş ve piyasa fiyatlarını önemli ölçüde etkilemiştir.

arrow_forward
code_blocks

High Bandwidth Memory 3 (Yüksek Bant Genişlikli Bellek 3. Nesil)

HBM3 (High Bandwidth Memory 3), yüksek performanslı yapay zeka hızlandırıcıları ve grafik işlemcileri için tasarlanmış üçüncü nesil yüksek bant genişlikli bellek standardıdır. SK Hynix tarafından 2022 yılında ticarileştirilen HBM3, JEDEC tarafından standardize edilmiş olup önceki nesil HBM2e'ye kıyasla bant genişliğini yaklaşık iki katına çıkarmıştır. HBM3, yığılmış bellek dieları ile Through-Silicon Via (TSV) teknolojisini birleştirerek çok yüksek veri aktarım hızlarına ulaşır. Her bellek yığını saniyede 819 GB'a varan bant genişliği sunarken yığın başına 24 GB'a kadar kapasite sağlar. Bu özellikler, büyük dil modellerinin eğitimi ve çıkarımı gibi bellek yoğun yapay zeka iş yükleri için HBM3'ü kritik bir bileşen hâline getirir. Geleneksel GDDR bellekle kıyaslandığında HBM3, aynı güç bütçesiyle 5-10 kat daha yüksek bant genişliği ve belirgin ölçüde daha düşük gecikme süresi sunar. TSV teknolojisi sayesinde bellek yığınları işlemcinin yanına doğrudan yerleştirilir; bu da veri yolu uzunluğunu minimuma indirerek enerji verimliliğini artırır. NVIDIA H100 GPU'su, HBM3 bellekle donatılmış ilk yaygın yapay zeka hızlandırıcısıdır ve 80 GB bellek kapasitesi ile 3,35 TB/s toplam sistem bant genişliği sunar. AMD MI300X hızlandırıcısı ise birden fazla HBM3 yığınını bir araya getirerek 192 GB'a varan bellek kapasitesiyle öne çıkmaktadır. Google'ın TPU v5 serisi de HBM3 tabanlı bellek mimarisini benimsemiştir. HBM3e (HBM3 Enhanced), 2024 yılında NVIDIA H200 GPU'su ile piyasaya sürülen geliştirilmiş versiyondur. Bant genişliğini yığın başına 1,2 TB/s düzeyine yükseltirken 141 GB kapasiteyle büyük ölçekli model çıkarımını güçlendirmiştir. Yapay zeka hızlandırıcısı talebinin hızla büyümesiyle birlikte HBM üretim kapasitesi küresel tedarik zincirinde kritik bir darboğaz hâline gelmiş; SK Hynix, Samsung ve Micron bu alanda yatırımlarını hızlandırmıştır. Bir sonraki nesil HBM4'ün 2025-2026 döneminde piyasaya girmesi beklenmektedir.

arrow_forward
developer_board

Hopper Architecture (Hopper Mimarisi)

Hopper Mimarisi, NVIDIA tarafından Mart 2022'de GTC (GPU Technology Conference) etkinliğinde tanıtılan ve büyük ölçekli yapay zeka modelleri ile yüksek performanslı hesaplama (HPC) iş yükleri için tasarlanmış yedinci nesil GPU mikro-mimarisidir. Bilgisayar biliminin öncüsü, ilk derleyici kavramının geliştiricisi ve COBOL standartlaşmasının mimarlarından biri olan Grace Hopper'ın anısına adlandırılan bu mimari, önceki nesil Ampere mimarisini (A100) veri merkezi segmentinde devralmıştır. Mimarinin en önemli yeniliği Transformer Engine adı verilen özel hesaplama birimidir. Bu birim, derin öğrenme modellerinin eğitimi sırasında FP8 ve FP16 sayısal hassasiyetleri arasında her işlem için otomatik ve dinamik geçiş yaparak hem hesaplama hızını hem de enerji verimliliğini önemli ölçüde artırır. FP8 hassasiyetindeki yeni Tensor Core'lar E4M3 (4 üs, 3 mantis biti) ve E5M2 (5 üs, 2 mantis biti) olmak üzere iki veri türünü destekler; bu sayede büyük dil modellerinin eğitim süresi, A100'e kıyasla FP8 düzeyinde 6 kata kadar kısaltılabilmektedir. Hopper GPU'ları TSMC 4N (4nm sınıfı) üretim süreciyle üretilmekte olup 80 milyar transistör içermektedir. HBM3 bellek teknolojisiyle 3 TB/s'ye ulaşan bellek bant genişliği, büyük model matrislerinin GPU'ya aktarımında darboğaz oluşmasını engeller. Dördüncü nesil NVLink bağlantısı (NVLink 4.0) ise çoklu GPU kümelerinde GPU'lar arası veri aktarım hızını önceki nesle göre iki katına çıkararak model paralelliğini kolaylaştırır. Multi-Instance GPU (MIG) teknolojisiyle tek bir H100 GPU'su, birbirinden yalıtılmış en fazla 7 bağımsız GPU örneğine bölünebilir. Bu özellik bulut servis sağlayıcıları için kaynak paylaşımı ve maliyet optimizasyonu açısından kritik önem taşır. Ek olarak Confidential Computing desteği, farklı kiracılara ait iş yüklerinin donanım düzeyinde şifrelenerek birbirinden korunmasına olanak tanır. PCIe Gen5 desteği de CPU ile GPU arasındaki veri transferini hızlandırmaktadır. Hopper mimarisinin veri merkezindeki öne çıkan ürünleri H100 ve H200 GPU'larıdır. Bu GPU'lar, GPT-4, LLaMA, Gemini ve benzeri büyük dil modellerinin eğitiminde dünya genelindeki veri merkezlerinde yaygın biçimde kullanılmaktadır. Hopper'ın ardından NVIDIA, 2024 yılında Blackwell mimarisini (B100, B200) duyurmuştur.

arrow_forward
play_arrow

Inference (Çıkarım (Model Çıkarımı))

Çıkarım (Inference), eğitilmiş bir yapay zeka modelinin yeni girdilere yanıt üretmek için kullanıldığı süreçtir. Eğitim aşamasının aksine çıkarım sırasında model ağırlıkları güncellenmez; model yalnızca ileri besleme (forward pass) yapar. Büyük dil modellerinde çıkarım iki belirgin aşamaya ayrılır. Prefill aşamasında tüm girdi tokenleri paralel olarak transformer katmanlarından geçirilir ve KV önbelleği (KV cache) doldurulur; bu aşama GPU'nun hesaplama kapasitesini yoğun kullanır. Decode aşamasında ise model her adımda yalnızca bir token üretir ve KV önbelleğini günceller; bu aşama bellek bant genişliğiyle sınırlıdır (memory-bound). Çıkarım performansı üç temel metrikle ölçülür: ilk token süresi (TTFT — time to first token), token başına gecikme (TPOT — time per output token) ve verim (throughput — saniyede toplam üretilen token). Etkileşimli uygulamalar düşük TTFT'yi, toplu işlem sistemleri ise yüksek verimi önceliklendirir. Çıkarım iki temel ortamda gerçekleştirilebilir. Bulut çıkarımında modeller veri merkezlerindeki sunucu GPU kümelerinde çalışır; ölçeklenebilirlik, büyük model desteği ve yönetilen altyapı avantajı sunar ancak veri dışarıya çıkar. Uç çıkarımda (edge inference) model kullanıcının cihazında çalışır; gecikme azalır, veri gizliliği artar ve çevrimdışı kullanım mümkün olur. Apple Silicon, Qualcomm Snapdragon ve NVIDIA Jetson gibi platformlardaki nöral işlemci birimleri (NPU) bu amaçla optimize edilmiştir; nicellenmiş küçük modeller (1B–7B, INT4) akıllı telefon ve dizüstü bilgisayarlarda gerçek zamanlı çalışabilmektedir. Gizlilik gerektiren uygulamalar (sağlık, finans) uç çıkarımı tercih eder. Üretim sistemleri için çıkarım optimizasyonu kritik öneme sahiptir: niceleme (INT8/INT4) model boyutunu küçültür; PagedAttention ve continuous batching GPU belleğini verimli kullanır; Flash Attention dikkat hesaplama hızını artırır; spekülatif kod çözme ise küçük bir taslak modelle büyük modelin doğrulamasını birleştirerek çözme hızını %2–3× artırabilir. vLLM, TGI, TensorRT-LLM ve Ollama bu amaçla kullanılan popüler açık kaynak araçlardır.

arrow_forward
code_blocks

NVIDIA NIM (NVIDIA NIM)

NVIDIA NIM (NVIDIA Inference Microservices), yapay zeka modellerini kurumsal ortamlarda hızlı, güvenli ve ölçeklenebilir biçimde devreye almak için tasarlanmış konteyner tabanlı bir mikroservis paketidir. Mart 2024'teki GTC konferansında duyurulan ve Nisan 2024'te NVIDIA AI Enterprise 5.0 kapsamında genel kullanıma açılan NIM, her biri bir Docker konteyneri olarak paketlenmiş hazır model servislerinden oluşur. Her NIM konteyneri; model ağırlıkları, otomatik olarak seçilen çıkarım arka ucu (TensorRT-LLM, vLLM veya SGLang) ve OpenAI API uyumlu bir REST API uç noktasından oluşur. Bu sayede geliştiriciler, mevcut OpenAI tabanlı uygulamalarını minimum kod değişikliğiyle kendi GPU altyapısına taşıyabilir. Çıkarım arka ucu, hedef GPU'ya ve model türüne göre otomatik seçilir; FP8, INT4 ve GGUF gibi nicemleme (quantization) formatları desteklenerek bellek kullanımı optimize edilir. NIM, NVIDIA'nın NGC (GPU Cloud) kataloğu üzerinden yüzlerce model sunar: Meta Llama 3.x ailesi (8B, 70B, 405B), Mistral, Google Gemma, Stable Diffusion, Whisper ve NVIDIA Cosmos video modelleri bu katalogda yer alır. Dağıtım ortamı esnekliği açısından NIM; yerel sunucularda, veri merkezlerinde ve Amazon AWS, Microsoft Azure ile Google Cloud gibi büyük bulut sağlayıcılarında çalışabilir. Kurumsal kullanım için NIM konteynerleri kriptografik olarak imzalanmış, CVE açık taramasından geçirilmiş ve SBOM (Yazılım Malzeme Listesi) belgesiyle birlikte yayımlanmıştır. Hava boşluklu (air-gapped) ortamlar da desteklenmektedir. KVKK gibi yerel düzenleyici gereksinimleri olan Türk kurumları için NIM, bulut bağımlılığını ortadan kaldırarak tam veri egemenliği sağlayan bir çözüm sunar. Kubernetes yerel ölçeklendirme desteği sayesinde NIM, düşük gecikme ve yüksek verim gerektiren üretim ortamları için idealdir; RAG pipeline'ları, ajan sistemleri ve gerçek zamanlı çıkarım uygulamalarında yaygın olarak kullanılmaktadır. NVIDIA'nın kendi kıyaslama ölçümlerine göre NIM, optimize edilmiş TensorRT-LLM arka ucuyla standart dağıtımlara kıyasla 3-5 kat daha yüksek token verimi sunabilmekte; bu avantaj özellikle yoğun üretim trafiğinde belirginleşmektedir.

arrow_forward
cable

NVLink (GPU Ara Bağlantısı)

NVLink, NVIDIA'nın GPU'lar arasında doğrudan, yüksek bant genişlikli ve düşük gecikmeli veri aktarımı kuran özel ara bağlantı teknolojisidir. Geleneksel PCIe veri yolunda GPU'lar birbirleriyle CPU üzerinden haberleşmek zorundadır; NVLink bu dolambaçlı yolu ortadan kaldırır ve bir GPU'nun diğerinin belleğine doğrudan erişmesine izin verir. Büyük dil modellerinin eğitiminde onlarca, hatta yüz binlerce GPU'nun aynı anda çalıştığı 2026 ortamında bu doğrudan bağlantı, çok-GPU sistemlerinin temel yapı taşı hâline geldi. Teknoloji 2016'da Pascal mimarili P100 GPU ile 160 GB/s toplam bant genişliğiyle tanıtıldı. Volta (V100) ile 300 GB/s'ye, Ampere (A100) ile 600 GB/s'ye, Hopper (H100/H200) ile 900 GB/s'ye çıkan değer, Blackwell (B200/GB200) mimarisindeki NVLink 5.0'da GPU başına 1,8 TB/s'ye ulaştı. Karşılaştırmak gerekirse PCIe 5.0 x16 yaklaşık 128 GB/s taşır; NVLink 5.0 bunun yaklaşık 14 katıdır. NVIDIA'nın yol haritasında 2026 sonunda gelmesi beklenen Vera Rubin platformuyla NVLink 6.0'ın bant genişliği GPU başına 3,6 TB/s'ye çıkacak. İkiden fazla GPU'yu birleştirmek için NVIDIA, NVSwitch anahtar yongasını geliştirdi. NVSwitch, tüm GPU'ları all-to-all (herkesten herkese) topolojide eşit bant genişliğiyle bağlar. Bu mimarinin en çarpıcı örneği GB200 NVL72 rafıdır: 72 Blackwell GPU tek bir NVLink alanında birleşir ve toplam 130 TB/s NVLink bant genişliğiyle tek bir dev GPU gibi programlanır. Mayıs 2025'te duyurulan NVLink Fusion programı, teknolojiyi ilk kez üçüncü taraflara açtı: MediaTek, Marvell, Fujitsu ve Qualcomm gibi firmalar kendi CPU ve özel yongalarını NVIDIA GPU'larına NVLink ile bağlayabiliyor. Buna karşılık AMD, Intel, Google ve Microsoft'un başını çektiği UALink konsorsiyumu, NVLink'e açık standart bir alternatif geliştirmeye çalışıyor. GPT-4 sonrası devasa modellerin eğitiminde gradyan senkronizasyonu ve tensor paralelliği trafiği PCIe kapasitesini kolayca aştığından, NVLink bugün yapay zeka altyapısındaki en kritik rekabet alanlarından biridir.

arrow_forward
developer_board

Tensor Core (Tensor Çekirdeği)

Tensor Core, NVIDIA'nın 2017'de Volta mimarisiyle (V100) tanıttığı, matris çarpma-biriktirme (Matrix Multiply-Accumulate, MMA: D = A × B + C) işlemini tek saat döngüsünde gerçekleştiren özel donanım birimidir. Derin öğrenme modellerinin hem eğitimi hem çıkarımı dev matris çarpmalarından oluştuğu için bu birimler, modern yapay zekâ hesaplamasının fiili motoru konumundadır. Klasik CUDA çekirdekleri genel amaçlı skaler ve vektör işlemler için tasarlanmıştır; Tensor Core ise sabit işlevli bir matris motorudur. Bir warp (32 iş parçacığı), `wmma` API'si üzerinden 16×16 matrisleri 4×4 bloklara bölerek işler ve aynı hassasiyetteki FP32 CUDA hesabına kıyasla teorik tepe verimini kata katlar: FP16 modunda yaklaşık 8×, düşük bitli formatlarda çok daha fazlası. En kritik yetenek karma hassasiyettir (mixed precision): çarpma FP16, BF16 veya FP8 gibi kısa formatlarda yapılırken biriktirme FP32'de tutulur. Böylece bellek bant genişliği ihtiyacı yarıya iner, model doğruluğu büyük ölçüde korunur. PyTorch'ta `torch.autocast`, TensorFlow'da `tf.keras.mixed_precision` bu donanımı şeffaf biçimde devreye alır; cuBLAS, cuDNN ve TensorRT kütüphaneleri de arka planda Tensor Core kullanır. Nesil gelişimi hızlıdır: Volta FP16 ile başladı, Turing (2018) INT8/INT4 ekledi, Ampere (A100, 2020) TF32, BF16 ve 2:4 yapısal seyreklik getirdi, Hopper (H100, 2022) FP8 ve Transformer Engine ile LLM eğitiminin standardı oldu. Blackwell (B200/GB200, 2024) 5. nesil Tensor Core'larda FP4 ve FP6 formatlarını, 2. nesil Transformer Engine'i ve mikro ölçekleme (MX) veri tiplerini tanıttı; B200 tek başına FP4'te 9 PFLOPS'u aşan yoğun matris verimi sunar. 2026 itibarıyla GPT, Claude, Gemini ve Llama sınıfı modellerin eğitimi on binlerce Blackwell GPU'luk kümelerde, çıkarımı ise FP8/FP4 nicemlemeyle Tensor Core'lar üzerinde koşar; NVIDIA'nın Rubin mimarisi de 2026 yol haritasında aynı çizgiyi sürdürür.

arrow_forward
memory

VRAM (GPU Belleği)

VRAM (Video RAM), GPU'nun (grafik işlemci birimi) üzerinde bulunan ve model ağırlıkları, aktivasyonlar ile ara hesaplama verilerini tutan yüksek bant genişlikli bellektir. Sistem RAM'i CPU'ya hizmet ederken VRAM doğrudan GPU çekirdeklerine bağlıdır ve GDDR7 ile 1 TB/s'nin üzerinde, HBM3e ile 8 TB/s'ye varan veri aktarım hızına ulaşır. Bu hız farkı, binlerce çekirdeğin aynı anda veri beklediği paralel hesaplamada belirleyicidir. Yapay zeka tarafında VRAM, çalıştırılabilecek modelin üst sınırını çizen ana donanım kısıtıdır. Bir büyük dil modelinin (LLM) tüm ağırlıkları çıkarım sırasında VRAM'e yüklenir: 7B parametreli bir model FP16 hassasiyetle yaklaşık 14 GB, 4-bit kuantizasyonla 4-5 GB yer kaplar; 70B sınıfı bir model ise FP16'da 140 GB isteyip INT4 ile 35-40 GB'a iner. Ağırlıkların üzerine, bağlam uzunluğuyla büyüyen KV cache ve batch verisi eklenir; 128K token bağlam tek başına gigabaytlarca ek VRAM tüketebilir. Kapasite aşıldığında model ya hiç yüklenmez ya da sistem RAM'ine taşarak (CPU offload) on kata varan yavaşlamayla çalışır. 2026 itibarıyla kapasite yelpazesi geniştir: tüketici tarafında RTX 5090 32 GB GDDR7, RTX 4090 24 GB sunar; veri merkezinde H100 80 GB, H200 141 GB, Blackwell B200 ise 192 GB HBM3e taşır. Apple Silicon farklı bir yol izler: M3 Ultra'da 512 GB'a çıkan birleşik bellek (unified memory), CPU ve GPU tarafından ortak kullanılır ve ayrı VRAM kavramını ortadan kaldırır. Eğitim senaryolarında VRAM ihtiyacı çıkarımın çok üzerine çıkar; geri yayılım aktivasyonları ve Adam optimizer durum tensörleri parametrelerin 3-4 katı ek bellek tüketir. LoRA ve QLoRA gibi parametre verimli ince ayar yöntemleri bu kısıtlamayı önemli ölçüde hafifletir. Gradyan kontrol noktası alma (gradient checkpointing) tekniği ise bellek-hesaplama takasıyla daha büyük batch boyutlarına izin verir. Yerel LLM çalıştırma, Stable Diffusion/Flux ile görüntü üretme veya LoRA ince ayarı planlayan herkes için ilk sorulacak soru işlemci hızı değil, kaç GB VRAM olduğudur. Model seçiminden donanım alımına kadar her kararda VRAM kapasitesi belirleyici etkendir.

arrow_forward
videogame_asset

WebGPU (WebGPU)

WebGPU, modern web tarayıcılarına düşük seviyeli GPU programlama kapasitesi sunan yeni nesil bir web standardıdır. W3C tarafından geliştirilen ve 2023 yılında Chrome ile Firefox'ta kararlı desteğe kavuşan WebGPU, eski WebGL API'sinin yerini alarak grafik ve genel amaçlı GPU hesaplama (GPGPU) yeteneklerini tarayıcıya taşır. WebGPU'nun yapay zeka açısından önemi büyüktür: GPU'nun paralel hesaplama gücü artık tarayıcı içindeki makine öğrenmesi modellerine doğrudan erişilebilir hale gelmiştir. TensorFlow.js ve ONNX Runtime Web, WebGPU arka ucu aracılığıyla görüntü sınıflandırma, doğal dil işleme ve ses tanıma gibi modelleri tarayıcıda saniyeler içinde çalıştırabilmektedir; bu işlemler için hiçbir bulut sunucusu gerekmez. Hugging Face'in Transformers.js kütüphanesi BERT, Whisper ve küçük dil modellerini WebGPU ile doğrudan tarayıcıda çalıştırmakta ve kullanıcı verileri cihazdan hiç ayrılmadan işlenmektedir. WebGL ile kıyaslandığında WebGPU çok daha modern ve esnek bir programlama modeli sunar. WGSL (WebGPU Shading Language) adlı yeni bir gölgelendirici dili, hem grafik hem de hesaplama (compute) shader yazımını birleştirip güçlendirir. Compute shader desteği WebGL'de sınırlıyken WebGPU bunu birinci sınıf özellik olarak sunar; bu da matris çarpımı, paralel sıralama ve nöral ağ çıkarımı gibi görevlerin verimli biçimde GPU üzerinde gerçekleştirilmesini mümkün kılar. WebGPU'nun programlama modeli Vulkan, Metal ve D3D12 gibi yerel grafik API'lerine bir soyutlama katmanıyla bağlanır; bu tasarım Windows, macOS ve Linux platformlarında tutarlı ve öngörülebilir bir davranış garantisi verir. Güvenlik, WebGPU tasarımının merkezindedir. Bellek izolasyonu, kaynak sınırlandırması ve tarayıcı güvenlik katmanları, GPU'ya doğrudan donanım erişiminin getirebileceği riskleri çok katmanlı önlemlerle yönetir. WebGPU, yerel yapay zeka çalıştırma vizyonunun web tarafındaki temel taşını oluşturmakta ve tarayıcıyı giderek daha güçlü bir yapay zeka çalışma ortamına dönüştürmektedir.

arrow_forward
code_blocks

H200 (NVIDIA H200 GPU)

H200, NVIDIA'nın veri merkezi GPU ailesinde Hopper mimarisinin en üst modeli olarak 2023 yılında duyurulmuş ve 2024 yılında kullanıma sunulmuş bir yapay zeka hızlandırıcısıdır. H100'ün doğrudan halefi olan H200'ün en çarpıcı özelliği, öncülünün 80 GB HBM3 belleğinin neredeyse iki katına ulaşan 141 GB HBM3e bellek kapasitesidir. Bu artış, bellek bant genişliğini 3,35 TB/s'den 4,8 TB/s'ye çıkararak büyük dil modellerinin (LLM) çıkarım (inference) süreçlerinde önemli bir hız avantajı sağlar. Yüksek bellek kapasitesi sayesinde LLaMA-3 70B, Falcon-180B veya benzeri büyük modeller tek bir GPU üzerinde tamamen barındırılabilir; bu durum model parçalama (tensor/pipeline parallelism) ihtiyacını azaltır ve istek başına gecikmeyi düşürür. H200, Amazon Web Services (p5e.48xlarge), Microsoft Azure (ND H200 v5 Series) ve Google Cloud gibi başlıca bulut sağlayıcıları aracılığıyla kiralık olarak sunulmaktadır. NVIDIA'nın GH200 Grace Hopper Süper Çip yapılandırmasında H200 GPU, NVIDIA Grace ARM işlemciyle 900 GB/s bant genişliğine sahip NVLink-C2C bağlantısıyla entegre edilmekte; bu da CPU-GPU veri aktarım darboğazını ortadan kaldırmaktadır. H200, eğitim görevlerinde H100 ile benzer hesaplama kapasitesini korurken, bellek yoğun LLM çıkarımında üç kata kadar daha yüksek verim sağlar. Yeni nesil Blackwell mimarisine (B100, B200) geçiş yapılana dek H200, yüksek performanslı yapay zeka altyapısının standardı olmayı sürdürmektedir.

arrow_forward
code_blocks

Heterogeneous Computing (Heterojen Hesaplama)

Heterojen hesaplama (heterogeneous computing), bir sistem içinde birden fazla farklı işlemci türünü — CPU, GPU, NPU, FPGA, DSP gibi — bir arada kullanan hesaplama mimarisidir. Bu yaklaşımın temel felsefesi, her iş yükünün doğası gereği farklı donanım özellikleri gerektirdiğidir: CPU'lar karmaşık kontrol akışları ve seri işlemler için idealken, GPU'lar binlerce çekirdeğiyle paralel matris işlemlerinde üstündür; NPU'lar ise sinir ağı çıkarımını düşük güç tüketimiyle gerçekleştirir. Yapay zeka uygulamalarında heterojen hesaplama son derece kritik hale gelmiştir. Büyük dil modellerinin (LLM) eğitimi GPU kümelerinde yapılırken, mobil cihazlarda çıkarım NPU'ların devreye girdiği hafif motor çözümleri sayesinde gerçek zamanlı ilerler. Apple M-serisi çipleri bu yaklaşımın somut örneğidir: aynı pakette yüksek performanslı CPU çekirdekleri, entegre GPU ve 16 çekirdekli Neural Engine birlikte çalışır; tüm bu birimler birleşik bellek mimarisi üzerinden veri alışverişi yapar ve kopyalama gecikmelerini minimize eder. Qualcomm Snapdragon platformu da benzer bir yapıya sahiptir: Kryo CPU çekirdekleri, Adreno GPU ve Hexagon DSP/Tensor Accelerator aynı SoC içinde yer alır. Veri merkezi tarafında ise NVIDIA Grace Hopper, 72 çekirdekli Arm CPU'yu H100 GPU ile yüksek bant genişlikli NVLink üzerinden birleştirerek LLM servis iş yüklerinde saniyede milyonlarca token işlem kapasitesi sunar. Heterojen hesaplamanın temel zorlukları programlama karmaşıklığı, bellek yönetimi ve veri taşıma yüküdür. Farklı işlemcilerin iş birliği yapabilmesi için OpenCL, SYCL, CUDA, HIP veya Intel oneAPI gibi programlama modelleri kullanılır. PCIe Gen 5 aracılığıyla CPU ile ayrık GPU arasında yaklaşık 32 GB/sn bant genişliği sağlanırken, NVIDIA NVLink bu değeri 900 GB/sn'ye taşır; ancak her iki durumda da bellek aktarım gecikmesi bir performans darboğazı oluşturabilir. Günümüzde heterojen hesaplama; akıllı telefon SoC'lerinden bulut sunucu kümelerine, otonom araç bilgisayarlarından endüstriyel IoT kenar (edge) cihazlarına kadar geniş bir yelpazede uygulanmaktadır. Yapay zekanın her alana yayılmasıyla birlikte bu mimari yaklaşım, güç verimliliği ve hesaplama performansı arasındaki dengeyi kuran temel tasarım paradigması haline gelmiştir.

arrow_forward
code_blocks

HPC (High Performance Computing) (Yüksek Başarımlı Hesaplama (HPC))

HPC (High Performance Computing), yani Yüksek Başarımlı Hesaplama; milyarlarca aritmetik işlemi saniyede eş zamanlı gerçekleştirebilen süper bilgisayar kümeleri, özel hızlandırıcı çipler ve yüksek hızlı ağlardan oluşan bilişim altyapılarına verilen genel addır. Geleneksel tek bir iş istasyonunun gücünü çok aşan bu sistemler; iklim modelleme, nükleer simülasyon, ilaç keşfi ve en önemlisi yapay zeka model eğitimi gibi hesaplama yoğun görevler için vazgeçilmezdir. Yapay zeka bağlamında HPC'nin önemi katlanarak artmaktadır: GPT-4 büyüklüğünde bir dil modeli, binlerce GPU'nun haftalarca paralel çalışmasını gerektirmektedir. NVIDIA'nın DGX SuperPOD kümeleri, Meta'nın RSC (Research SuperCluster) altyapısı ve Google'ın TPU Pod sistemleri, AI eğitiminde kullanılan önde gelen HPC örnekleridir. Temel HPC bileşenleri şunlardır: çok çekirdekli CPU ve GPU düğümleri, düşük gecikmeli ve yüksek bant genişliğine sahip ağ ara yüzleri (InfiniBand, NVLink), yüksek bant genişlikli depolama sistemleri (Lustre, GPFS) ve iş yükü zamanlayıcıları (SLURM, PBS Pro). Performans ölçümü FLOPS (floating-point operations per second) cinsinden yapılır; günümüzdeki öncü sistemler exaFLOPS (10^18 işlem/saniye) sınırına yaklaşmaktadır. Türkiye'de TÜBİTAK ULAKBİM bünyesindeki Truba kümesi, üniversiteler ve araştırma kurumları için HPC kapasitesi sunmaktadır. Bulut sağlayıcılar (AWS HPC, Azure HPC, Google Cloud HPC) ise on-premise yatırım gerektirmeksizin talep anında ölçeklenebilen esnek HPC ortamları sağlamaktadır.

arrow_forward
code_blocks

PCIe (PCI Express)

PCIe (PCI Express / Peripheral Component Interconnect Express), modern bilgisayarlarda GPU, NVMe SSD ve yüksek hızlı ağ kartları gibi bileşenleri ana karta bağlayan seri, nokta-nokta yüksek bant genişliği veri yolu standardıdır. Yapay zeka ve derin öğrenme iş yüklerinde GPU'nun CPU belleğinden eğitim verisini ve model ağırlıklarını ne kadar hızlı aktarabildiğini doğrudan belirleyen kritik bir arayüzdür. Teknik açıdan PCIe, x1, x4, x8 ve x16 olmak üzere dört temel şerit (lane) konfigürasyonunda çalışır. Yapay zeka eğitim ve çıkarım GPU'ları tipik olarak x16 tam bağlantıyla takılır. Her PCIe nesli, tek şerit teorik bant genişliğini yaklaşık iki katına çıkarır. PCIe 3.0 x16, çift yönde ~32 GB/s toplam bant genişliği sunarken PCIe 4.0 ~64 GB/s, PCIe 5.0 ~128 GB/s ve henüz piyasaya yeni giren PCIe 6.0 ~256 GB/s kapasitesine ulaşır. Gizli Kodlama (encoding) yükü bu teorik değerden yaklaşık %20 oranında düşer. Yapay zeka perspektifinden PCIe bant genişliği iki kritik yerde darboğaz oluşturur. Birincisi, CPU RAM'inden GPU VRAM'ine veri transferidir; batch yükleme süreçlerinde GPU'nun veri beklemesi "host-to-device transfer latency" olarak bilinir ve PCIe nesli ile doğrudan ilişkilidir. İkincisi, çok-GPU kurulumlarında GPU'lar arasındaki iletişimdir; NVLink veya CXL gibi doğrudan GPU-GPU köprüleri mevcut değilse, tüm GPU-GPU trafiği PCIe üzerinden CPU'ya ve oradan geri dönmek zorunda kalır. NVIDIA A100 ve H100 veri merkezi GPU'ları PCIe 4.0/5.0 x16 ile, tüketici segmentindeki RTX 4090 PCIe 4.0 x16 ile gelir. AMD Instinct MI300X, PCIe 5.0 x16 desteği sunar. Apple Silicon (M-serisi) çiplerinde CPU-GPU arasında PCIe değil, Unified Memory Architecture (UMA) kullandığından bu darboğaz kavramsal olarak ortadan kalkar. Türkiye'de üniversite araştırma grupları ve AI startup'ları GPU sunucu kurulumlarında PCIe nesil uyumluluğunu, özellikle PCIe 3.0'lı eski anakartlarda PCIe 4.0 GPU kullanımında oluşan bant genişliği kayıplarını göz önünde bulundurmaktadır.

arrow_forward
speed

vLLM (vLLM)

vLLM, UC Berkeley'de geliştirilen ve büyük dil modellerinin (LLM) üretim ortamında hızlı ve verimli biçimde sunulmasını sağlayan açık kaynaklı bir çıkarım (inference) kütüphanesidir. Temel yeniliği olan PagedAttention mekanizması, KV önbelleğini işletim sistemlerindeki sanal bellek yönetiminden ilham alarak sayfalara böler ve dinamik olarak tahsis eder. Bu yaklaşım bellek parçalanmasını minimuma indirerek GPU belleğinin çok daha verimli kullanılmasına olanak tanır. Continuous batching özelliğiyle birleşince vLLM, standart HuggingFace Transformers pipeline'larına kıyasla 24 kata kadar daha yüksek throughput elde edebilir. vLLM, 2023 yılında SOSP konferansında yayımlanan akademik makaleyle tanıtıldı ve kısa sürede yapay zeka topluluğunun en çok kullandığı LLM servis altyapısı haline geldi. Proje GitHub'da 40K'ı aşan yıldızla aktif bir geliştirici kitlesine sahip olmaya devam etmektedir. OpenAI uyumlu REST API sunan vLLM, mevcut sistemlere minimal değişiklikle entegre edilebilmektedir. Teknik açıdan vLLM; Llama, Mistral, Qwen, Gemma ve diğer popüler modelleri destekler. Tensor parallelism ve pipeline parallelism ile modeli birden fazla GPU'ya dağıtabilir, quantization (AWQ, GPTQ, bitsandbytes) ile bellek gereksinimini düşürür. LoRA adaptörlerini çalışma zamanında dinamik olarak yükleyip kaldırabilmesi birden fazla görev için tek bir model örneğini paylaşmaya imkân tanır. Türkiye'de yapay zeka tabanlı ürün geliştiren şirketler ve araştırma kurumları, vLLM'i özellikle maliyet optimizasyonu amacıyla tercih etmektedir. Aynı GPU kümesinde standart kütüphanelere kıyasla çok daha yüksek istek kapasitesi sunulabilmesi, bulut maliyetlerini önemli ölçüde düşürür. Yerli yapay zeka altyapılarında veri egemenliğini korurken yüksek performans elde etmek isteyen kurumlar için kritik bir araçtır. vLLM, OpenAI uyumlu API sunduğundan mevcut entegrasyonlar minimum değişiklikle kendi altyapısına taşınabilir; bu da geçiş sürecini hızlandıran önemli bir avantajdır. Akademik temelli olmasına karşın hızla olgunlaşan proje, kurumsal destek almak isteyen ekipler için de güvenilir bir tercih olmayı sürdürmektedir.

arrow_forward