PCIe Neden Yetmiyor, NVLink Nasıl Çözüyor?
Yapay zeka modelleri tek bir GPU'nun belleğine sığmayacak kadar büyüdü: Llama 3.1 405B, yalnızca FP16 ağırlıkları için yaklaşık 810 GB bellek ister; en güçlü tekil GPU olan B200'ün belleği ise 192 GB'dir. Model birden fazla GPU'ya bölündüğünde, her ileri ve geri geçişte GPU'lar arasında yoğun aktivasyon ve gradyan trafiği oluşur. PCIe üzerinden bu trafik iki sorunla karşılaşır: bant genişliği düşüktür (PCIe 5.0 x16 için ~128 GB/s) ve iletişim CPU'nun bellek denetleyicisi üzerinden dolaşır. NVLink her iki sorunu birden çözer. GPU'lar birbirine noktadan noktaya bağlanır, CPU tamamen devre dışı kalır ve bir GPU diğerinin HBM belleğini kendi adres alanının parçası gibi okuyup yazabilir. NVLink 5.0'da her GPU, her biri 100 GB/s çift yönlü taşıyan 18 bağlantıya sahiptir; toplamda 1,8 TB/s'ye ulaşır. Gecikme de mikrosaniyeler düzeyinden yüz nanosaniyeler düzeyine iner ki All-Reduce gibi senkronizasyon işlemlerinde asıl farkı bu yaratır.
Nesil Nesil NVLink: 160 GB/s'den 3,6 TB/s'ye
pascal NVLink 1.0 — Pascal (2016)
P100 GPU ile tanıtıldı; 4 bağlantıyla toplam 160 GB/s sundu ve dönemin PCIe 3.0'ını beşe katladı.
volta NVLink 2.0 — Volta (2017)
V100 ile 6 bağlantı ve 300 GB/s'ye çıktı; DGX-1 sunucularıyla derin öğrenme merkezlerinde yaygınlaştı.
ampere NVLink 3.0 — Ampere (2020)
A100 ile 12 bağlantı, 600 GB/s; üçüncü nesil NVSwitch ile 8 GPU tek sanal birim gibi kullanılır oldu.
hopper NVLink 4.0 — Hopper (2022)
H100/H200 ile 18 bağlantı, 900 GB/s; ChatGPT sonrası LLM eğitim patlamasının donanım omurgası oldu.
blackwell NVLink 5.0 — Blackwell (2024)
B200/GB200 ile GPU başına 1,8 TB/s; NVL72 rafında 72 GPU tek NVLink alanında birleşti.
rubin NVLink 6.0 — Vera Rubin (2026)
NVIDIA yol haritasına göre 2026 sonunda Rubin GPU'larla gelecek; GPU başına 3,6 TB/s ve NVL144 raf ölçeği hedefleniyor.
NVSwitch ve NVL72: Raf Ölçeğinde Tek GPU
İki GPU doğrudan NVLink kablosuyla bağlanabilir; ancak sekiz, on altı veya yetmiş iki GPU'nun tamamının birbiriyle tam hızda konuşması için anahtarlama gerekir. NVSwitch, her GPU'yu diğer tüm GPU'lara eşit bant genişliğiyle bağlayan all-to-all bir ağ kurar. HGX H100 platformunda 4 NVSwitch yongası 8 GPU'yu birleştirir ve 3,6 TB/s toplam ikili bant genişliği üretir. Blackwell nesliyle ölçek raf düzeyine taşındı. GB200 NVL72 sisteminde 36 Grace CPU ve 72 Blackwell GPU, 9 NVSwitch tepsisi ve 5.000'den fazla bakır kabloyla tek bir NVLink alanında toplanır; agregat bant genişliği 130 TB/s'dir. Yazılım açısından bu raf, 13,5 TB HBM3e belleğe sahip tek bir dev GPU gibi görünür. Daha büyük kümelerde NVL72 rafları InfiniBand veya Spectrum-X Ethernet ile birbirine bağlanır; xAI'ın Colossus'u ve Microsoft'un Azure AI kümeleri gibi 100.000+ GPU'luk kurulumlar bu hiyerarşiyle çalışır.
Yapay Zeka Eğitimi ve Çıkarımındaki Rolü
- check_circle Tensor paralelliği: Bir transformer katmanının matrisleri GPU'lara bölündüğünde her token için GPU'lar arası veri alışverişi gerekir; bu trafik NVLink üzerinde PCIe'ye kıyasla ~14 kat hızlı akar.
- check_circle Gradyan senkronizasyonu (All-Reduce): Veri paralel eğitimde her adımda milyarlarca parametrenin gradyanı GPU'lar arasında toplanır. NVLink bu adımı milisaniyeler içinde bitirip GPU'ların boşta bekleme oranını düşürür.
- check_circle Uzman paralelliği (MoE): DeepSeek-V3 ve Mixtral gibi karma-uzman modellerde tokenlar farklı GPU'lardaki uzmanlara yönlendirilir; bu all-to-all trafik deseni NVSwitch'in tam ağ topolojisine birebir uyar.
- check_circle Büyük model çıkarımı: 405B+ parametreli modeller tek GPU'ya sığmadığından katmanlar birden çok GPU'ya dağıtılır; NVLink düşük gecikmeyle token başına yanıt süresini kısaltır.
- check_circle KV-cache ve bellek havuzlama: Uzun bağlam pencerelerinde (128K-1M token) KV-cache tek GPU belleğini aşar; NVLink, komşu GPU'ların HBM'ini tek havuz gibi kullanmaya imkân verir.
Rakipler ve Alternatifler (2026)
ualink UALink
AMD, Intel, Google, AWS ve Microsoft destekli açık standart; 1.0 spesifikasyonu 2025'te yayımlandı, 1024 hızlandırıcıya kadar ölçeklenmeyi hedefliyor.
infinity-fabric AMD Infinity Fabric
MI300X/MI355X hızlandırıcılarında GPU'lar arası bağlantıyı üstlenir; 8 GPU'luk düğümlerde NVLink'in doğrudan rakibidir.
nvlink-fusion NVLink Fusion
Computex 2025'te duyuruldu; MediaTek, Marvell, Fujitsu ve Qualcomm gibi firmaların özel CPU/ASIC'lerini NVIDIA ekosistemine NVLink ile bağlamasına izin verir.
ethernet Ultra Ethernet / RoCE
Raf ölçeğini aşan (scale-out) küme iletişiminde NVLink'in yerini InfiniBand ve Ultra Ethernet alır; iki teknoloji rakip değil tamamlayıcıdır.
Sık Sorulan Sorular
- check_circle NVLink ile PCIe arasındaki fark nedir?: PCIe, GPU'ların CPU üzerinden haberleştiği genel amaçlı bir standarttır; NVLink ise GPU'ları CPU'yu atlayarak doğrudan bağlayan NVIDIA'ya özel bir teknolojidir. NVLink 5.0 (1,8 TB/s), PCIe 5.0 x16'nın (~128 GB/s) yaklaşık 14 katı bant genişliği taşır.
- check_circle NVLink 5.0 kaç TB/s bant genişliği sunar?: Blackwell (B200/GB200) GPU'lardaki NVLink 5.0, her biri 100 GB/s taşıyan 18 bağlantıyla GPU başına toplam 1,8 TB/s sunar; bu, NVLink 4.0'ın (900 GB/s) tam iki katıdır.
- check_circle GeForce RTX kartlarında NVLink var mı?: Hayır. RTX 3090'dan sonra tüketici kartlarından NVLink köprüsü kaldırıldı; RTX 40 ve 50 serisi yalnızca PCIe kullanır. NVLink günümüzde veri merkezi GPU'larına (H100, H200, B200, GB200) özeldir.
- check_circle NVSwitch olmadan NVLink çalışır mı?: Evet, iki GPU doğrudan bağlanabilir. Ancak üç ve üzeri GPU'nun tamamının birbiriyle tam hızda konuşması için NVSwitch gerekir; NVSwitch olmadan bant genişliği GPU çiftleri arasında bölünür.
- check_circle NVLink Fusion nedir?: Mayıs 2025'te duyurulan program; üçüncü taraf yonga üreticilerinin (MediaTek, Marvell, Fujitsu, Qualcomm) kendi CPU ve özel hızlandırıcılarını NVLink üzerinden NVIDIA GPU'larına bağlamasına izin verir. NVLink'in ilk kez ekosistem dışına açılmasıdır.
- check_circle NVLink 6.0 ne zaman gelecek?: NVIDIA'nın GTC 2025 yol haritasına göre NVLink 6.0, 2026 sonunda Vera Rubin platformuyla (NVL144) gelecek ve GPU başına 3,6 TB/s bant genişliği hedefliyor.