tag mimari

Data Mesh (Veri Ağı)

Bu sayfada mimari (Data Mesh (Veri Ağı)) etiketi ile işaretlenmiş 7 yapay zeka kavramını bulabilirsiniz.

Data Mesh, büyük organizasyonlarda veri yönetiminin getirdiği merkezi darboğaz ve ölçek sorunlarını çözmek amacıyla Zhamak Dehghani'nin 2019'da önerdiği merkezsiz veri mimarisi yaklaşımıdır. Kavram ilk olarak "How to Move Beyond a Monolithic Data Lake to a Distributed Data Mesh" başlıklı makalede detaylandırılmıştır. Geleneksel yaklaşımlarda veriler merkezi bir veri ambarı ya da data lake'te toplanır; bu yapı küçük organizasyonlarda yeterli olsa da büyük kuruluşlarda üç kritik sorun üretir: merkezi veri ekibinin darboğaz haline gelmesi, veri setlerinin güncelliğini yitirmesi ve iş birimlerinin hızlı analitik ihtiyaçlarını karşılayamaması. Data Mesh bu monolitik yapıya alan odaklı, merkezsiz bir alternatif sunar. Yaklaşım dört temel ilkeye dayanır. Birincisi, alan sahipliği: veriler onu en iyi anlayan domain ekiplerinin sorumluluğundadır. İkincisi, veri ürünü: her veri kümesi; keşfedilebilir, belgelenmiş, güvenilir ve SLA'ya bağlı bir "ürün" olarak tasarlanır. Üçüncüsü, self-servis veri platformu: alan ekipleri merkezi mühendislik desteğine gerek kalmadan veri ürünlerini oluşturup yayımlayabilir. Dördüncüsü, federe yönetişim: bağımsız alanlar arasında veri kalitesi, güvenlik ve standart tanımları merkezi politikalarla uyumlu tutulur. Uygulama araçları arasında Apache Kafka (olay akışı), Snowflake veya Databricks Lakehouse (depolama ve sorgu), dbt (dönüşüm katmanı) ve DataHub/Amundsen (veri kataloğu) öne çıkar. Kafka 4.0, ZooKeeper bağımlılığını ortadan kaldırarak çok kiracılı Data Mesh ortamlarını önemli ölçüde basitleştirmiştir. AWS Data Zones, Azure Purview ve Google Dataplex gibi bulut hizmetleri de yerleşik Data Mesh desteği sunmaktadır. IBM'in 2024 verilerine göre şirketlerin yüzde seksen ikisi veri silolarının yapay zeka projelerini engellediğini bildiriyor; Gartner'a göre organizasyonların yüzde altmış biri yapay zeka baskısıyla veri işletme modelini yeniden yapılandırıyor. Data Mesh, bu dönüşümün teknik ve organizasyonel altyapısını bütünleşik biçimde ele alan kapsamlı bir çerçeve sunmaktadır.

code_blocks

Data Mesh (Veri Ağı)

Data Mesh, büyük organizasyonlarda veri yönetiminin getirdiği merkezi darboğaz ve ölçek sorunlarını çözmek amacıyla Zhamak Dehghani'nin 2019'da önerdiği merkezsiz veri mimarisi yaklaşımıdır. Kavram ilk olarak "How to Move Beyond a Monolithic Data Lake to a Distributed Data Mesh" başlıklı makalede detaylandırılmıştır. Geleneksel yaklaşımlarda veriler merkezi bir veri ambarı ya da data lake'te toplanır; bu yapı küçük organizasyonlarda yeterli olsa da büyük kuruluşlarda üç kritik sorun üretir: merkezi veri ekibinin darboğaz haline gelmesi, veri setlerinin güncelliğini yitirmesi ve iş birimlerinin hızlı analitik ihtiyaçlarını karşılayamaması. Data Mesh bu monolitik yapıya alan odaklı, merkezsiz bir alternatif sunar. Yaklaşım dört temel ilkeye dayanır. Birincisi, alan sahipliği: veriler onu en iyi anlayan domain ekiplerinin sorumluluğundadır. İkincisi, veri ürünü: her veri kümesi; keşfedilebilir, belgelenmiş, güvenilir ve SLA'ya bağlı bir "ürün" olarak tasarlanır. Üçüncüsü, self-servis veri platformu: alan ekipleri merkezi mühendislik desteğine gerek kalmadan veri ürünlerini oluşturup yayımlayabilir. Dördüncüsü, federe yönetişim: bağımsız alanlar arasında veri kalitesi, güvenlik ve standart tanımları merkezi politikalarla uyumlu tutulur. Uygulama araçları arasında Apache Kafka (olay akışı), Snowflake veya Databricks Lakehouse (depolama ve sorgu), dbt (dönüşüm katmanı) ve DataHub/Amundsen (veri kataloğu) öne çıkar. Kafka 4.0, ZooKeeper bağımlılığını ortadan kaldırarak çok kiracılı Data Mesh ortamlarını önemli ölçüde basitleştirmiştir. AWS Data Zones, Azure Purview ve Google Dataplex gibi bulut hizmetleri de yerleşik Data Mesh desteği sunmaktadır. IBM'in 2024 verilerine göre şirketlerin yüzde seksen ikisi veri silolarının yapay zeka projelerini engellediğini bildiriyor; Gartner'a göre organizasyonların yüzde altmış biri yapay zeka baskısıyla veri işletme modelini yeniden yapılandırıyor. Data Mesh, bu dönüşümün teknik ve organizasyonel altyapısını bütünleşik biçimde ele alan kapsamlı bir çerçeve sunmaktadır.

arrow_forward
code_blocks

Grouped-Query Attention (Gruplu Sorgu Dikkati (GQA))

Grouped-Query Attention (GQA, Gruplu Sorgu Dikkati), transformer mimarisindeki dikkat mekanizmasını hem bellek hem de hesaplama açısından daha verimli hale getiren bir varyanttır. Yöntem 2023 yılında Google Research ekibinden Joshua Ainslie ve arkadaşları tarafından "GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints" makalesiyle önerildi ve kısa sürede Llama 2 70B, Llama 3, Mistral 7B, Gemma 2 ve Qwen 2.5 gibi açık ağırlıklı modellerin ortak tercihi oldu. Klasik çok başlı dikkat (Multi-Head Attention, MHA) mimarisinde her sorgu (query) başı kendine ait bir anahtar-değer (key-value, K-V) çiftine sahiptir. Bu yapı en yüksek model kapasitesini sunar; ancak çıkarım sırasında üretilen her token için tüm K-V başlarının önbellekte tutulması gerekir ve uzun bağlamlarda GPU belleği hızla dolar. Multi-Query Attention (MQA) ise tüm sorgu başlarını tek bir K-V çiftiyle eşleştirir; bellek kullanımı çok düşer, fakat model kalitesinde ölçülebilir kayıp görülebilir ve eğitim kararsızlaşabilir. GQA bu iki uç arasında ayarlanabilir bir orta yol kurar. H adet sorgu başı G gruba bölünür ve her gruptaki başlar tek bir K-V çiftini paylaşır. KV önbelleğinin boyutu artık H ile değil G ile ölçeklenir; G = H olduğunda yapı MHA'ya, G = 1 olduğunda MQA'ya dönüşür. Llama 3 8B modeli 32 sorgu başını 8 K-V başıyla eşleştirir; bu yapılandırma MHA'ya kıyasla KV önbelleğini dört kat küçültür. 70B modelde 64 sorgu başı yine 8 K-V başını paylaşır ve tasarruf sekiz kata çıkar. Pratik sonuçları belirgindir: aynı GPU belleğiyle 128K token ve üzeri bağlam pencereleri işlenebilir, saniyede üretilen token sayısı artar ve çok kullanıcılı üretim ortamlarında daha büyük batch boyutları çalıştırılabilir. GQA, FlashAttention çekirdekleri ve RoPE konum kodlamasıyla doğrudan uyumludur; vLLM, TensorRT-LLM ve llama.cpp gibi çıkarım motorları bu yapıyı yerel olarak destekler. Ainslie ve arkadaşlarının deneyleri, MHA ile eğitilmiş bir modelin K-V başlarının ortalama havuzlama ile birleştirilip kısa bir ek eğitim (uptraining) uygulanarak, orijinal eğitim bütçesinin yaklaşık yüzde beşiyle GQA'ya dönüştürülebildiğini göstermiştir.

arrow_forward
code_blocks

Heterogeneous Computing (Heterojen Hesaplama)

Heterojen hesaplama (heterogeneous computing), bir sistem içinde birden fazla farklı işlemci türünü — CPU, GPU, NPU, FPGA, DSP gibi — bir arada kullanan hesaplama mimarisidir. Bu yaklaşımın temel felsefesi, her iş yükünün doğası gereği farklı donanım özellikleri gerektirdiğidir: CPU'lar karmaşık kontrol akışları ve seri işlemler için idealken, GPU'lar binlerce çekirdeğiyle paralel matris işlemlerinde üstündür; NPU'lar ise sinir ağı çıkarımını düşük güç tüketimiyle gerçekleştirir. Yapay zeka uygulamalarında heterojen hesaplama son derece kritik hale gelmiştir. Büyük dil modellerinin (LLM) eğitimi GPU kümelerinde yapılırken, mobil cihazlarda çıkarım NPU'ların devreye girdiği hafif motor çözümleri sayesinde gerçek zamanlı ilerler. Apple M-serisi çipleri bu yaklaşımın somut örneğidir: aynı pakette yüksek performanslı CPU çekirdekleri, entegre GPU ve 16 çekirdekli Neural Engine birlikte çalışır; tüm bu birimler birleşik bellek mimarisi üzerinden veri alışverişi yapar ve kopyalama gecikmelerini minimize eder. Qualcomm Snapdragon platformu da benzer bir yapıya sahiptir: Kryo CPU çekirdekleri, Adreno GPU ve Hexagon DSP/Tensor Accelerator aynı SoC içinde yer alır. Veri merkezi tarafında ise NVIDIA Grace Hopper, 72 çekirdekli Arm CPU'yu H100 GPU ile yüksek bant genişlikli NVLink üzerinden birleştirerek LLM servis iş yüklerinde saniyede milyonlarca token işlem kapasitesi sunar. Heterojen hesaplamanın temel zorlukları programlama karmaşıklığı, bellek yönetimi ve veri taşıma yüküdür. Farklı işlemcilerin iş birliği yapabilmesi için OpenCL, SYCL, CUDA, HIP veya Intel oneAPI gibi programlama modelleri kullanılır. PCIe Gen 5 aracılığıyla CPU ile ayrık GPU arasında yaklaşık 32 GB/sn bant genişliği sağlanırken, NVIDIA NVLink bu değeri 900 GB/sn'ye taşır; ancak her iki durumda da bellek aktarım gecikmesi bir performans darboğazı oluşturabilir. Günümüzde heterojen hesaplama; akıllı telefon SoC'lerinden bulut sunucu kümelerine, otonom araç bilgisayarlarından endüstriyel IoT kenar (edge) cihazlarına kadar geniş bir yelpazede uygulanmaktadır. Yapay zekanın her alana yayılmasıyla birlikte bu mimari yaklaşım, güç verimliliği ve hesaplama performansı arasındaki dengeyi kuran temel tasarım paradigması haline gelmiştir.

arrow_forward
memory

Mamba (Mamba)

Mamba, 2023 yılında Carnegie Mellon Üniversitesi'nden Albert Gu ve Princeton Üniversitesi'nden Tri Dao tarafından yayımlanan 'Mamba: Linear-Time Sequence Modeling with Selective State Spaces' makalesiyle tanıtılan, Transformer mimarisine güçlü bir alternatif sunan dizi modelleme yaklaşımıdır. Geleneksel Transformer'lar, dizi içindeki her iki token çifti arasında dikkat (attention) hesaplaması yaparak O(n²) zaman ve bellek karmaşıklığı üretir. Bu, dizi uzunluğu arttıkça bellek gereksinimini katlanarak büyütür ve çok uzun bağlamları (örneğin 100.000 token) pratik olarak işlemeyi güçleştirir. Mamba bu sorunu temel düzeyde farklı bir yaklaşımla çözer: giriş dizisini gizli bir durum vektörü (hidden state) üzerinden ardışık olarak işleyen Seçici Durum Uzayı Modellerini (Selective State Space Models — S4/SSM) benimseyerek O(n) doğrusal karmaşıklıkla çalışır. Mamba'nın önceki durum uzayı modellerinden temel farkı 'seçicilik' (selectivity) mekanizmasıdır. Klasik SSM'lerde A, B, C geçiş matrisleri sabit parametrelerdir ve girişten bağımsız aynı dönüşümü uygularlar. Mamba'da ise bu parametreler her giriş tokenine göre dinamik biçimde hesaplanır: model, o andaki token değerine bakarak hangi bilginin gizli duruma yazılacağına, hangisinin unutulacağına her adımda ayrı ayrı karar verebilir. Bu esneklik sayesinde model hem kısa bağımlılıkları hem de çok uzak konumlardaki uzun bağımlılıkları (long-range dependencies) başarıyla yakalayabilmektedir. Donanım verimliliği açısından Mamba özgün bir çözüm sunar. Eğitim sırasında paralel tarama (parallel scan) algoritması kullanarak GPU'ların yoğun paralel hesaplama kapasitesinden yararlanır. Çıkarım (inference) aşamasında ise gizli durum boyutu sabit kaldığından bellek gereksinimi dizinin uzunluğuyla artmaz — bu özellik özellikle çok uzun bağlamlarda (100K+ token) belirleyici bir avantaj sağlar. Mamba mimarisi dil modellemesinden biyoinformatiğe, ses sinyali işlemeden zaman serisi tahminlemeye kadar geniş bir yelpazede uygulanmaktadır. AI21 Labs'ın Jamba modeli, Mamba ve Transformer katmanlarını hibrit biçimde birleştirerek her iki yaklaşımın güçlü yönlerinden yararlanan önemli bir örnek oluşturmuştur. Araştırmalar, benzer parametre sayısına sahip Transformer modelleriyle kıyaslandığında Mamba'nın özellikle uzun dizi senaryolarında verimlilik avantajının belirginleştiğini ve bazı görevlerde rekabetçi kalite sonuçları ürettiğini ortaya koymaktadır.

arrow_forward
code_blocks

Mixture of Depths (Derinlik Karışımı)

Mixture of Depths (MoD, Türkçesiyle Derinlik Karışımı), transformer tabanlı dil modellerinde her tokenin her katmandan geçmesi kuralını gevşeten, hesaplama bütçesini token ve katman bazında dinamik olarak dağıtan bir adaptif hesaplama yöntemidir. Google DeepMind araştırmacıları (Raposo ve arkadaşları) tarafından 2024 yılında yayımlanan "Mixture-of-Depths: Dynamically allocating compute in transformer-based language models" makalesiyle tanıtıldı. Çıkış noktası basit bir gözlemdir: bir dizideki tokenlerin hepsi aynı derecede zor değildir; bazı tokenler için tam dikkat ve ileri besleme hesaplaması gereksizdir. Standart transformer bu farkı görmez ve her tokene aynı miktarda hesaplama harcar. MoD'de her transformer bloğunun başında hafif bir yönlendirici (router) bulunur. Yönlendirici her token için skaler bir ağırlık üretir; en yüksek ağırlığa sahip ilk k token bloğun tam işleminden (öz-dikkat ve MLP) geçer, kalan tokenler artık bağlantı (residual connection) üzerinden değişmeden bir sonraki bloğa aktarılır. Buradaki k değeri sabit bir kapasite olarak önceden belirlenir; makalede en iyi sonuçlar her iki blokta bir yönlendirme yapıp kapasiteyi dizinin %12,5'i ile sınırlamakla elde edilmiştir. Kapasitenin sabit olması önemli bir mühendislik avantajı getirir: tensör boyutları önceden bilindiği için hesaplama grafiği statik kalır ve donanım verimliliği erken çıkış (early exit) gibi dinamik yöntemlere göre çok daha iyidir. Yöntem, Mixture of Experts (MoE) ile sık karıştırılır ama farklı bir ekseni kontrol eder. MoE bir tokenin hangi uzman ağ tarafından işleneceğini seçerken, MoD tokenin bu blokta işlenip işlenmeyeceğini seçer. İki yaklaşım birbirine dik olduğundan aynı modelde birleştirilebilir; makale bu birleşimi MoDE (Mixture of Depths and Experts) adıyla sunar. Deneysel sonuçlara göre MoD modelleri, eşit eğitim FLOPs bütçesinde temel modellerden daha düşük kayıp değerine ulaşır; eşit kalitede ise ileri geçiş başına FLOPs belirgin biçimde azalır ve örnekleme sırasında adım süresi %50'ye kadar kısalır. MoD'nin en dikkat çekici zorluğu otoregresif üretimdir. Top-k seçimi dizideki tüm tokenleri görmeyi gerektirir, oysa üretim sırasında gelecekteki tokenler henüz yoktur. Makale bunun için iki çözüm önerir: yönlendirici çıktısına eklenen yardımcı bir ikili sınıflandırma kaybı ya da tokenin ilk k'ye girip girmeyeceğini tahmin eden küçük bir yardımcı MLP. Her iki yaklaşım da kalite kaybını ihmal edilebilir düzeyde tutar. MoD günümüzde araştırma aşamasında olup çok modlu büyük modeller için γ-MoD ve p-MoD gibi türevleri yayımlanmıştır.

arrow_forward
🔒

Security by Design (Tasarımda Güvenlik)

Security by Design (Tasarımda Güvenlik), siber güvenlik önlemlerinin yazılım veya sistemin geliştirme yaşam döngüsünün her aşamasına başından itibaren entegre edildiği proaktif bir mühendislik felsefesidir. Bu yaklaşımda güvenlik açıkları piyasaya çıkıldıktan sonra yamalanmak yerine, ürünün mimarisi tasarlanırken engellenir. Geleneksel "güvenliği sonradan ekleme" (security bolt-on) yaklaşımı hem daha maliyetli hem de daha az etkilidir; araştırmalar güvenlik açığını geliştirme aşamasında düzeltmenin, prodüksiyonda düzeltmeye kıyasla 30 kat daha ucuz olduğunu göstermektedir. Dört temel prensip bu yaklaşımı yönlendirir. Saldırı yüzeyini en aza indir — yalnızca gerekli işlevleri etkinleştir, gereksiz hizmetleri kapat. En az ayrıcalık (least privilege) — her bileşen, yalnızca işlevi için gereken minimum izinlerle çalışır. Savunma derinliği (defense in depth) — güvenliği tek bir katmana bırakma; ağ, uygulama ve veritabanı düzeyinde bağımsız kontroller uygula. Güvenli varsayılanlar (secure defaults) — sistem ilk kurulumda en güvenli yapılandırmayla gelsin; kullanıcı isteğe bağlı olarak kısıtlamaları gevşetebilmeli, sıkılaştırmak zorunda kalmamalıdır. Yapay zeka sistemlerinde Security by Design kritik bir boyut kazanmaktadır. Eğitim verisi zehirlenmesi (data poisoning), çıkarım aşamasında istem enjeksiyonu (prompt injection), düşmanca örnekler (adversarial examples) ve model çalma (model stealing) saldırıları; geliştirme sürecine erken dahil edilen güvenlik katmanlarıyla önlenebilir. Federated learning, diferansiyel gizlilik ve güvenilir yürütme ortamları (TEE) bu yaklaşımın yapay zeka özelindeki araçlarıdır. Düzenleyici çerçeveler bu prensibi yasal zorunluluk hâline getirmiştir. GDPR'ın 25. Maddesi "tasarımla veri koruma" (privacy by design) ilkesini doğrudan hukuki zemine taşırken, AB Yapay Zeka Yasası yüksek riskli AI sistemleri için teknik sağlamlık ve güvenlik gerekliliklerini kapsamlı biçimde düzenlemektedir. NIST SP 800-160 ve CISA'nın Secure by Design kılavuzu yazılım üreticileri için referans standartlar olarak öne çıkmaktadır. Bu belgeler tehdit modellemesinin (threat modeling) her geliştirme sprintine entegre edilmesini ve güvenlik gereksinimlerinin tasarım belgelerine erken aşamada girilmesini tavsiye eder.

arrow_forward
code_blocks

Self-Attention (Öz-Dikkat)

Öz-dikkat (self-attention), bir dizideki her tokenin aynı dizinin diğer tüm tokenleriyle ilişkisini hesaplayarak her konuma bağlam bilgisi kazandıran dikkat mekanizmasının özel bir biçimidir. Klasik dikkat mekanizmasında kaynak ve hedef diziler farklıydı; örneğin makine çevirisinde giriş cümlesi ile çıkış cümlesi ayrı dizilerdi. Öz-dikkatte ise sorgu (Q), anahtar (K) ve değer (V) vektörlerinin üçü de aynı girişten türetilir. 2017 yılında "Attention Is All You Need" makalesiyle tanıtılan transformer mimarisinin temel yapı taşı olan öz-dikkat, RNN ya da CNN katmanlarına gerek kalmadan uzun mesafeli bağımlılıkları paralel hesaplamayla öğrenir. Hesaplama üç adımda ilerler. Önce giriş gömmeleri üç ayrı projeksiyon matrisiyle Q, K ve V uzaylarına dönüştürülür. Ardından her konumun sorgu vektörü tüm anahtar vektörleriyle nokta çarpımına girer, sonuç sqrt(d_k) ile ölçeklenir ve softmax uygulanarak dikkat ağırlıkları elde edilir. Son olarak bu ağırlıklar değer vektörleri üzerinde ağırlıklı toplam alınarak her token için yeni bir bağlamsal temsil üretir. "Banka kıyısında oturdu" cümlesindeki "banka" tokeni, "kıyı" tokenine yüksek ağırlık vererek finans kurumu değil nehir kenarı anlamını kodlar. Matematiksel olarak n uzunluğundaki bir dizi için öz-dikkat O(n^2 · d) hesaplama ve bellek maliyeti gerektirir; bu nedenle çok uzun dizilerde düşük ranklı yaklaşımlar (Linformer), yerel pencere dikkati (Longformer, Sliding Window Attention) ve FlashAttention gibi IO-farkında verimlilik teknikleri geliştirilmiştir. Maskeli öz-dikkat (masked self-attention), GPT ve Llama gibi otoregresif dil modellerinde kullanılır: her konum yalnızca önceki konumlara bakabilir, gelecekteki tokenlere erişim üst üçgen maskeyle kapatılır. BERT gibi çift yönlü kodlayıcılarda ise tam öz-dikkat uygulanır; her token hem öncesindeki hem sonrasındaki tokenleri görür ve sınıflandırma görevleri için güçlü bir bağlam temsili oluşur. Uygulamada öz-dikkat tek başına değil, çok başlı dikkat (multi-head attention) biçiminde birden fazla paralel başla çalıştırılır; her baş sözdizimi, eş gönderim ya da konum yakınlığı gibi farklı ilişki türlerini yakalar. Vision Transformer görüntü yamalarını, AlphaFold2 ise protein kalıntılarını token olarak işleyerek aynı mekanizmayı dil dışına taşımıştır.

arrow_forward