Intel Gaudi

Intel'in Habana Labs teknolojisiyle geliştirdiği, derin öğrenme eğitimi ve çıkarımı için optimize edilmiş AI hızlandırıcı serisi.

Intel Gaudi, Intel'in 2019 yılında yaklaşık 2 milyar dolara satın aldığı İsrailli yapay zeka çip firması Habana Labs tarafından geliştirilen AI hızlandırıcı serisidir. Seri, derin öğrenme modellerinin eğitimi ve büyük dil modellerinin çıkarımı (inference) için özel olarak tasarlanmıştır. Gaudi 3, serinin en güncel neslidir. TSMC'nin 5 nm süreci üzerinde üretilmektedir. 64 Tensör İşlem Çekirdeği (TPC) ve 8 Matris Çarpma Motoru (MME) barındırır. Bellek tarafında 128 GB HBM2E ve 3,7 TB/s bant genişliği sunar. Ağ bağlantısı için 24 adet 200 GbE bağlantı noktası entegre edilmiş olup küme düzeyinde 9,6 Tbps çift yönlü bant genişliği sağlar. BF16/FP8 operasyonlarında 1.835 TFLOPS hesaplama kapasitesi sunan Gaudi 3, NVIDIA H100 ve H200 karşısında fiyat-performans avantajıyla konumlandırılmaktadır; birim fiyatı H100'ün belirgin şekilde altındadır. Intel'in yayımladığı kıyaslama verilerine göre LLaMA ve Mistral gibi büyük dil modellerinde H100'e kıyasla 2 kat daha yüksek çıkarım hızı elde edilmektedir. Gaudi'nin önemli bir özelliği, standart Ethernet ağ mimarisini kullanmasıdır. NVLink gibi tescilli ağ çözümlerine gerek kalmadan çok düğümlü kümeler kurulmasını mümkün kılar. Yazılım ekosistemi PyTorch, TensorFlow ve Intel'in kendi SynapseAI SDK'sı üzerine kuruludur. AWS DL1 ve DL2 bulut örnekleri, IBM Cloud ve Supermicro sunucularında kullanıma sunulmuştur. Temel zorluk, NVIDIA'nın CUDA ekosistemine kıyasla mevcut yapay zeka kütüphanelerinin büyük bölümünün öncelikle CUDA için optimize edilmiş olmasıdır. Geliştiricilerin Gaudi'ye geçişte mevcut kodlarını uyarlamaları gerekmektedir. Bu durum, kurumsal benimsemede önemli bir sürtünme noktası olmayı korumaktadır.

Tarihçe: Habana Labs'tan Intel'e

Intel Gaudi serisi, 2019 yılında Intel tarafından yaklaşık 2 milyar dolara satın alınan İsrailli yapay zeka çip şirketi Habana Labs tarafından geliştirilmiştir. Habana Labs, 2016 yılında derin öğrenme iş yükleri için özel donanım tasarlamak amacıyla kuruldu. İlk ürün olan Gaudi 1, 2020 yılında Amazon Web Services'in DL1 bulut örneklerinde kullanılmaya başlandı. Satın almayla birlikte Intel, veri merkezi AI çip pazarında NVIDIA'ya karşı somut bir alternatif konumlandırma fırsatı elde etti ve AI donanım alanında köklü bir uzmanlık biriktirdi.

Gaudi 3 Mimarisi ve Teknik Özellikler

Gaudi 3, serinin en güncel neslidir ve TSMC'nin 5 nm üretim süreci üzerinde üretilmektedir. 64 Tensör İşlem Çekirdeği (TPC) ve 8 Matris Çarpma Motoru (MME) barındıran Gaudi 3, BF16/FP8 operasyonlarında 1.835 TFLOPS hesaplama kapasitesi sunar. Bellek tarafında 128 GB HBM2E yığını ile 3,7 TB/s bellek bant genişliği elde edilmektedir. Güç tüketimi yaklaşık 600 W TDP düzeyindedir. Önceki nesle kıyasla BF16 operasyonlarında 4 kat artış kaydedilmiştir.

Ağ ve Ölçeklenebilirlik

Gaudi 3'ün öne çıkan özelliklerinden biri, çipe entegre 24 adet 200 GbE Ethernet bağlantı noktasıdır. Bu bağlantı noktaları toplam 9,6 Tbps çift yönlü ağ bant genişliği sağlar. Standart Ethernet kullanımı, NVIDIA'nın tescilli NVLink ve NVSwitch mimarisinin aksine var olan ağ altyapısıyla uyumluluk anlamına gelir. Gaudi 3 çiplerinin birden fazla sunucuda ya da düğümde bir araya getirilmesiyle büyük AI kümeleri oluşturmak, ek tescilli ağ donanımı gerektirmeden mümkündür.

NVIDIA H100 ile Karşılaştırma

Intel, Gaudi 3'ü doğrudan NVIDIA H100 ve H200 ile rekabette konumlandırmaktadır. Birim fiyatı açısından Gaudi 3 (yaklaşık 15.000 USD), NVIDIA H100'den (25.000–30.000 USD) belirgin şekilde daha ucuzdur. Intel'in kıyaslama verilerine göre LLaMA ve Mistral gibi büyük dil modellerinde Gaudi 3, H100'e kıyasla 2 kat daha yüksek çıkarım hızı sunar. Bağımsız testler, özellikle karmaşık eğitim iş yüklerinde H100'ün üstünlüğünü koruyabildiğini göstermektedir. Temel rakip avantaj, performans başına daha düşük toplam sahip olma maliyetidir (TCO).

Ekosistem, Yazılım ve Kullanım Alanları

Gaudi çipleri; PyTorch, TensorFlow ve Intel'in kendi SynapseAI SDK'sı aracılığıyla programlanabilir. Hugging Face Optimum Habana paketi, Transformers tabanlı modellerin Gaudi üzerinde çalışmasını kolaylaştırır. Bulut tarafında AWS DL1/DL2 örnekleri ve IBM Cloud erişim noktaları mevcuttur. LLM eğitimi ve çıkarımı, bilgisayarlı görü ve öneri sistemleri birincil kullanım alanlarını oluşturur. Temel zorlu nokta, mevcut AI kütüphanelerinin önemli bir bölümünün öncelikle CUDA için optimize edilmiş olmasıdır.