NPU Nedir ve CPU/GPU'dan Farkı Nedir?
CPU (Central Processing Unit), genel amaçlı karmaşık mantık operasyonları için tasarlanmıştır; az sayıda güçlü çekirdek, yüksek saat hızı ve büyük önbellek ile çalışır. GPU (Graphics Processing Unit) ise başlangıçta grafik işlemi için geliştirilmiş olsa da büyük ölçekli paralel hesaplama yeteneğiyle AI eğitiminde standart haline gelmiştir. NPU ise bu iki mimari arasında tamamen farklı bir niş kaplar: yapay zeka inference (çıkarım) için özelleşmiş, düşük güç tüketimli bir ivedilendiricisi.
Temel fark, veri akış mimarisindedir. Bir yapay zeka modelinde en kritik işlem, büyük matris çarpımı ve evrişim (konvolüsyon) operasyonlarıdır. NPU tasarımcıları bu iki işlemi on-chip doğrudan gerçekleştirecek özel devre blokları (MAC dizileri) inşa eder. Böylece bellek-işlemci arasındaki veri transferi en aza indirilir; bu da hem gecikmeyi hem de güç tüketimini önemli ölçüde azaltır.
NPU Mimarisinin Temel Bileşenleri
MAC Dizileri (Multiply-Accumulate Arrays): Sinir ağı hesabının özü olan w×x+b işlemini paralel gerçekleştiren özel çarpma-toplama birimleri. Binlerce MAC ünitesi aynı anda farklı matris elemanları üzerinde çalışır.
On-Chip SRAM Tamponları: Ağırlık matrislerini ve aktivasyonları yonga üzerinde tutmak için kullanılan hızlı bellek. Harici DRAM'e erişim minimuma indirilir; bu, hem gecikmeyi hem de dinamik güç tüketimini düşürür.
Aktivasyon Motoru: ReLU, GELU ve Sigmoid gibi aktivasyon fonksiyonlarını donanım düzeyinde hesaplayan özel devreler.
Yeniden Yapılandırılabilir Veri Yolları (Dataflow Engine): Farklı ağ mimarileri (CNN, Transformer, RNN) birbirinden farklı hesaplama akışı gerektirir. Modern NPU'lar bu akışları yazılım düzeyinde yeniden yapılandırabilecek esnek bir veri yolu sunar.
Düşük Hassasiyetli Hesaplama Desteği: INT4, INT8, FP16 ve BF16 gibi veri tiplerini doğal olarak destekleyen devreler. Tam FP32 yerine INT8 kullanmak, aynı TOPS bütçesiyle çok daha fazla işlem yapılmasını sağlar.
Yaygın NPU Uygulamaları ve Performans Karşılaştırması
Apple Neural Engine: A11 Bionic ile başlayan ve M4 çipinde 38 TOPS'a ulaşan bu NPU, iPhone ve Mac cihazlarında Siri, Face ID ve fotoğraf işleme gibi on-device AI görevleri için kullanılmaktadır.
Qualcomm Hexagon NPU: Snapdragon 8 Gen serisi mobil işlemcilere entegre olup on-device LLM çalıştırma, gerçek zamanlı çeviri ve kamera AI yetenekleri için optimize edilmiştir.
Intel NPU (Meteor Lake / Lunar Lake): Birleşik CPU+GPU+NPU mimarisine sahip Intel Core Ultra serisi, on-device Copilot+ özellikleri için Windows PC'lerde 40 TOPS eşiğini aşmaktadır.
Google Tensor NPU: Pixel akıllı telefonlarında bulunan bu NPU, Google'ın kendi AI modellerini (Gemini Nano dahil) cihaz üzerinde çalıştırmasına olanak tanır.
Bağımsız NPU Hızlandırıcılar: Veri merkezi ortamında Cambricon, Graphcore ve Groq gibi şirketler yalnızca AI inference için tasarlanmış bağımsız NPU çiplerini pazarlamaktadır.
Önde Gelen NPU Çipleri
Apple Neural Engine
A-serisi ve M-serisi SoC'lara entegre. M4'te 38 TOPS. Core ML çerçevesi ile optimize edilir; Face ID, Siri, fotoğraf semantik arama bu NPU'yu kullanır.
Qualcomm Hexagon NPU
Snapdragon 8 Gen 3'te 45 TOPS. Android AI deneyimlerini (gerçek zamanlı çeviri, kamera AI) destekler. AIMET ile INT4/INT8 kuantizasyon optimize edilir.
Samsung Myriad X / Exynos NPU
Exynos 2400'de 34.4 TOPS. On-device büyük dil modeli çalıştırmayı hedefler. Galaxy AI özelliklerinin altyapısı.
Intel AI Boost (Meteor Lake)
Intel'in tüketici CPU'larına eklenen ilk entegre NPU. 10-34 TOPS arasında. Windows AI PC tanımlamasını karşılamak için Microsoft minimum 40 TOPS belirledi.
compare NPU, GPU ve CPU Karşılaştırması
- check_circle İşlem türü: CPU → genel amaçlı sıralı; GPU → paralel matris ops (CUDA); NPU → sabit sinir ağı grafı (MAC array).
- check_circle Güç verimliliği: NPU, aynı AI iş yükünü CPU'ya kıyasla 5-20×, GPU'ya kıyasla 3-10× daha az güçle gerçekleştirir.
- check_circle Esneklik: CPU en esnek (her yazılım); GPU çok esnek; NPU en kısıtlı — özel operatörleri desteklemeyebilir.
- check_circle Gecikme: Küçük model çıkarım gecikmesi (< 100ms) NPU'da en düşük; GPU latency büyük batch'te üstün.
- check_circle Programlama: GPU → CUDA/ROCm; NPU → üretici SDK'sı (Core ML, SNPE, OpenVINO) veya ONNX Runtime NPU backend.
- check_circle Kullanım senaryosu: Her zaman açık, düşük güçlü cihaz AI → NPU; büyük model eğitimi/çıkarım → GPU; iş mantığı → CPU.
Sık Sorulan Sorular (SSS)
- check_circle NPU ile GPU arasındaki temel fark nedir? GPU, geniş paralel hesaplama yeteneğiyle AI model eğitimi için idealdir; NPU ise eğitilmiş modellerin düşük güç tüketimiyle cihaz üzerinde çalıştırılması (inference) için optimize edilmiştir. Güç-verimlilik açısından NPU, GPU'ya kıyasla 5–10× avantaj sağlar.
- check_circle TOPS değeri ne anlama gelir? TOPS (Tera Operations Per Second), saniyede gerçekleştirilen bir trilyon işlem anlamına gelir. Bir NPU'nun TOPS değeri ne kadar yüksekse, saniyede o kadar fazla AI hesaplama adımı gerçekleştirebilir. Copilot+ PC için Microsoft minimum 40 TOPS şartı koşmaktadır.
- check_circle NPU hangi AI görevlerini hızlandırır? Nesne tanıma, ses işleme, doğal dil işleme (NLP), yüz tanıma, otomatik tamamlama ve gerçek zamanlı çeviri gibi inference ağırlıklı görevler NPU'nun en iyi performans gösterdiği alanlardır. LLM token üretimi de modern NPU'larda giderek daha yaygın hale gelmektedir.
- check_circle NPU yoksa AI uygulamaları çalışmaz mı? Hayır, NPU'suz cihazlar da CPU veya GPU üzerinde AI çalıştırabilir; ancak daha yavaş ve daha fazla güç tüketerek. NPU, bu işlemleri özel devre yapısıyla hızlandırarak pil ömrü ve gerçek zamanlı performans açısından kritik avantaj sağlar.