İşlem elemanlarının ızgara topolojisinde veriyi ritmik akışla işlediği, Google TPU'nun temel aldığı paralel donanım mimarisi.

Sistolik dizi (systolic array), işlem elemanlarının (PE — processing element) düzenli bir ızgara topolojisinde dizilerek verinin komşu elemanlar arasında ritmik (darbeli) bir akışla işlendiği özel amaçlı paralel donanım mimarisidir. 1978'de Carnegie Mellon Üniversitesi'nden H.T. Kung ve Charles Leiserson tarafından önerilen bu mimari, "veri kalbe kan gibi pompalanır" metaforundan adını alır. Sistolik dizinin temel çalışma prensibi şudur: her saat döngüsünde veriler ızgara boyunca bir adım kayar; her işlem elemanı kendisine gelen kısmi sonucu bir önceki eleman verisiyle birleştirerek bir sonraki elemana iletir. Bu yaklaşım, verinin tek bir merkezi belleğe gidip gelmesi yerine işlem elemanları arasında yerel olarak akmasını sağlar; böylece bellek bant genişliği darboğazı dramatik biçimde azaltılır. Yapay zeka donanımlarında sistolik dizi mimarisi kritik bir rol üstlenmektedir. Google'ın Tensör İşleme Birimi (TPU), 2016 yılında 256×256 sistollik dizi üzerine inşa edilmiş olarak duyurulmuş ve sinir ağı matris çarpımları için saniyede 92 teraflops performans sunmuştur. Matris çarpımı — derin öğrenme modellerinin en temel hesaplama ilkeli — sistolik mimaride son derece verimli gerçekleştirilir: ağırlık matrisi sabit tutulurken aktivasyonlar dizi üzerinden akar ya da tam tersi bir akış uygulanır. GPU'larla karşılaştırıldığında sistolik diziler farklı bir hesaplama paradigmasını temsil eder. GPU genel amaçlı paralel hesaplama için binlerce çekirdek içerirken, sistolik dizi belirli bir hesaplama kalıbı (özellikle matris-matris çarpımı) için optimize edilmiş özel bir hattır. Bu nedenle eğitim gibi çeşitli iş yüklerine kıyasla çıkarım (inference) gibi sabit hesaplama kalıbı gerektiren görevlerde daha verimlidir. Google TPU v4 ve v5 ile Groq LPU da bu mimarinin modern temsilcileridir.

Sistolik Dizi Nedir?

Sistolik dizi (systolic array), işlem elemanlarının (PE — processing element) düzenli bir ızgara topolojisinde dizildiği ve verinin bu elemanlar arasında ritmik (darbeli) bir akışla işlendiği özel amaçlı paralel donanım mimarisidir. 1978'de Carnegie Mellon Üniversitesi'nden H.T. Kung ve Charles Leiserson tarafından önerilen bu mimari, 'veri kalbe kan gibi pompalanır' metaforundan adını alır. Temel prensip şudur: her saat döngüsünde veriler ızgara boyunca bir adım kayar; her işlem elemanı kendisine gelen kısmi sonucu komşu eleman verisiyle birleştirerek bir sonraki elemana iletir. Böylece veri tek bir merkezi belleğe gidip gelmek yerine işlem elemanları arasında yerel olarak akar.

Neden Yapay Zeka Donanımı İçin İdeal?

Derin öğrenme modellerinin en temel hesaplama işlemi matris-matris çarpımıdır (General Matrix Multiply — GEMM). Tam bağlı katmanlar, dikkat mekanizmaları (attention) ve evrişim katmanları, tümü özünde büyük matris çarpımlarına indirgenir. Sistolik dizi bu hesaplamayı bellek bant genişliği darboğazı yaratmadan gerçekleştirmek için tasarlanmıştır: ağırlık matrisi işlem elemanlarında sabit tutulurken aktivasyon verileri dizi üzerinden akar ya da tam tersi bir akış uygulanır. Her eleman yalnızca yerel komşusuyla iletişim kurduğundan küresel veri yolu trafiği minimuma iner. Bu özellik özellikle çıkarım (inference) sırasında — yani modelin sabit ağırlıklarla tekrarlı matris hesaplamaları yaptığı aşamada — enerji verimliliğini ve iş hacmini (throughput) GPU'ya kıyasla önemli ölçüde artırır.

Sistolik Dizi Tabanlı AI Donanımları

🔵 Google TPU v1 (2016)

256×256 sistolik dizi, saniyede 92 teraops (INT8) matris çarpımı. Veri merkezi çıkarımı için tasarlandı; eğitimde GPU'ya kıyasla 15-30× daha enerji verimli olduğu raporlandı.

🟢 Google TPU v4/v5

Pod konfigürasyonunda 4096 TPU çipi birbirine yüksek hızlı interconnect ile bağlanır. Gemini ve PaLM gibi büyük modellerin eğitimi ve çıkarımı bu altyapıda gerçekleştirilmektedir.

🟡 Groq LPU

Groq'un Language Processing Unit mimarisi de benzer bir veri akış prensibi benimser. Sabit ağırlıklar çipin bellek hiyerarşisine yerleştirilir; veri tek yönlü deterministik bir hattan geçer.

🔴 Cerebras WSE

Wafer-Scale Engine, sistolik dizi mantığını tam bir wafer üzerine yayarak 850.000 AI çekirdeği içerir. Çip sınırı aşan veri transferini ortadan kaldırarak çok büyük modellerin eğitimini hızlandırır.

GPU ile Karşılaştırma

GPU ve sistolik dizi farklı hesaplama paradigmalarını temsil eder. GPU, binlerce genel amaçlı CUDA çekirdeğiyle çok çeşitli paralel iş yüklerini destekler; programlama esnekliği yüksektir ve eğitim sırasında değişen hesaplama kalıplarına uyum sağlar. Sistolik dizi ise belirli bir hesaplama kalıbı — çoğunlukla matris-matris çarpımı — için özel tasarlanmış bir hattır. Bu odak, belirli iş yüklerinde enerji verimliliğini ve gecikmeyi (latency) GPU'nun önüne geçirir; ancak genel amaçlı hesaplamada esneklik kaybı yaşanır. Bu yüzden üretim sistemlerinde çıkarım için TPU/özel çip, araştırma ve eğitim için GPU kombinasyonu tercih edilmektedir.

Çalışma Prensibi: Adım Adım Matris Çarpımı

İki N×N matrisin sistolik dizide çarpılmasını somutlaştıralım. Dizi N×N PE'den oluşur. İlk saat döngüsünde A matrisinin ilk satırının ilk elemanı sol kenardan girer; B matrisinin ilk sütununun ilk elemanı üst kenardan girer. Her eleman kendi çarpma-toplama (multiply-accumulate) işlemini yapar ve sonucu alt/sağ komşusuna iletir. Sonraki döngülerde veriler kayarak tüm eleman çiftleri hesaplanır. Toplam N döngü sonunda tüm sonuç matrisi elde edilir. Bu süreçte her PE yalnızca iki yerel iletişim kanalı kullanır; merkezi belleğe erişim yoktur. Sonuç: N×N² işlem N döngüde, N² PE ile paralel tamamlanır.

Sık Sorulan Sorular

  • check_circle Sistolik dizi neden GPU'dan daha enerji verimli olabilir?: GPU'da her işlem için DRAM'e erişim gerekebilir; bellek erişimi hesaplama işleminden 100× daha fazla enerji tüketir. Sistolik dizide veri PE'ler arasında lokal olarak akar; merkezi belleğe gidiş-dönüş sayısı dramatik biçimde azalır. Bu fark özellikle büyük matris boyutlarında ve yüksek tekrar sayısında (inference batch) belirginleşir.
  • check_circle TPU sadece Google'a mı özel?: Google'ın TPU'ları Google Cloud TPU hizmeti aracılığıyla herkese açıktır. JAX ve TensorFlow çerçeveleri TPU'da yerel olarak çalışır; PyTorch için de XLA (Accelerated Linear Algebra) köprüsü mevcuttur. Bunların yanı sıra AWS Trainium/Inferentia, Intel Gaudi ve Graphcore IPU gibi farklı mimariler de özel AI çip pazarında yer almaktadır.
  • check_circle Eğitim mi çıkarım mı için daha uygundur?: Sistolik diziler hem eğitim hem çıkarımda kullanılabilir; ancak tasarım optimizasyonları genellikle çıkarım için daha belirgindir. Eğitim sürecinde geri yayılım (backpropagation) ve ağırlık güncellemeleri ek hesaplama deseni gerektirir. Google TPU v2/v3'ten itibaren eğitim desteği de güçlendirilmiştir.
  • check_circle FPGA ile sistolik dizi arasındaki ilişki nedir?: FPGA (Field-Programmable Gate Array) üzerinde yazılımla sistolik dizi tasarımı gerçekleştirilebilir; bu yaklaşım araştırma ve prototipleme için yaygındır. FPGA'nın yeniden programlanabilir mantık blokları, farklı boyutlarda sistolik dizileri simüle etmeye olanak tanır. Üretim sistemlerinde ise özel ASIC olarak gerçekleştirilen sistolik diziler (TPU gibi) çok daha yüksek verimlilik sunar.
  • check_circle Attention mekanizması sistolik dizide nasıl çalışır?: Transformer'ların dikkat mekanizması, Q·K^T ve sonucunun V ile çarpılmasından oluşan iki matris çarpımına indirgenir. Her iki çarpım da sistolik dizi üzerinde verimli biçimde gerçekleştirilir. Uzun context uzunluklarında dikkat matrisinin boyutu büyüdüğünden bellek yönetimi kritik hâle gelir; bu nedenle modern TPU'lar büyük HBM yığınlarıyla birleştirilmektedir.