MoE Routing Nedir?
Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. Geleneksel dense mimarilerinde her token modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar, ardından softmax fonksiyonuyla en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez; böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur. Bu özellik, MoE'yi "sparse" (seyrek) mimari olarak da tanımlar.
Gate Fonksiyonu ve Top-K Seçimi
Router ağı genellikle bir softmax kapı fonksiyonu ile çalışır: giriş tokeninin gömme vektörüne (embedding) küçük bir projeksiyon matrisi uygulanır ve her uzman için bir ağırlık üretilir. En yüksek ağırlıklı K uzman seçilir; seçilen uzmanların çıktıları ağırlıklı ortalama ile birleştirilir. Mixtral 8x7B mimarisinde 8 uzman bulunur ve her token için 2'si seçilir; böylece yaklaşık 13B aktif parametre ile 47B toplam parametre kapasitesi ayrışır. DeepSeek-V3'te ise 256 uzman arasından 8'i seçilir — bu yapı hem kapasiteyi hem uzmanlaşmayı derinleştirir. K değeri genellikle 2 ile 8 arasında tutulur; daha yüksek K daha fazla hesaplama maliyeti ancak daha zengin temsil anlamına gelir.
Yük Dengeleme ve Router Collapse
MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router, tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu durum model kapasitesini etkin biçimde düşürür ve donanım verimliliğini bozar. Önüne geçmek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir; bu ek kayıp uzmanların tüm tokenlere eşit dağılmasını teşvik eder. DeepSeek-V3, bu sorunu "auxiliary-loss-free load balancing" yöntemiyle farklı bir açıdan çözer: ek kayıp yerine yönlendirici biasını dinamik biçimde ayarlar. Yük dengeleme aynı zamanda GPU'lar arası bant genişliğini verimli kullanmak açısından da kritiktir.
Token-Choice ve Expert-Choice Routing
- check_circle Token-Choice Routing: Her token hangi uzman(lar)ı tercih ettiğini seçer. En yaygın paradigma olmakla birlikte router collapse riski taşır ve eğitimde yük dengeleme kaybı gerektirir. Mixtral ve GPT-4 bu yaklaşımı benimser.
- check_circle Expert-Choice Routing: Her uzman işleyeceği token kümesini kendisi seçer; belirli bir kapasite sınırına kadar en yüksek ağırlıklı tokenleri alır. Doğal yük dengesi sunar; ancak bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini barındırır.
Avantajlar ve Kısıtlamalar
- check_circle Büyük kapasite, sabit maliyet: Dense modele kıyasla 4-8× daha büyük toplam parametre kapasitesi, token başına sabit FLOP maliyetiyle elde edilir.
- check_circle Uzman uzmanlaşması: Farklı uzmanlar farklı dil kalıpları veya bilgi alanlarında uzmanlaşabilir; bu durum modelin genel kapasitesini artırır.
- check_circle Eğitim verimliliği: Aynı eğitim bütçesiyle dense modele göre daha yüksek kalite elde edilir. DeepSeek-V3, GPT-4 seviyesi performansı belirgin biçimde daha düşük maliyetle sunmuştur.
- check_circle Yüksek VRAM gereksinimi: Aktif olmayan uzmanlar da bellekte tutulur; MoE modelleri benzer performanstaki dense modellere göre çok daha fazla GPU belleği gerektirir.
- check_circle Karmaşık eğitim dinamiği: Router collapse riski, yük dengeleme hiperparametreleri ve uzman kapasite sınırlamaları eğitimi zorlaştırır; dikkatli ayar ve izleme gerektirir.
Sık Sorulan Sorular
- check_circle MoE routing neden dense modellere göre daha verimlidir?: Dense modeller her token için tüm parametreleri hesaplar; MoE ise token başına yalnızca seçili K uzmanı etkinleştirir. Toplam parametre büyük tutulurken hesaplama maliyeti sabit kalır; aynı FLOP bütçesiyle çok daha derin bilgi kapasitesi elde edilir.
- check_circle Router collapse nedir ve nasıl önlenir?: Router collapse, yönlendiricinin tüm tokenleri yalnızca birkaç uzmana göndermesi ve diğer uzmanların atıl kalmasıdır. Yük dengeleme kaybı (auxiliary loss) veya DeepSeek-V3'te kullanılan dinamik bias ayarı bu sorunu önlemek için kullanılır.
- check_circle Top-K değeri nasıl belirlenir?: Mixtral gibi modeller K=2, DeepSeek-V3 K=8 kullanır. Düşük K daha az hesaplama maliyeti sunar; yüksek K daha zengin temsil ancak daha fazla kaynak gerektirir. Araştırmalar çoğu görev için K=2'nin iyi bir başlangıç noktası olduğunu göstermektedir.
- check_circle MoE mimarisini hangi modeller kullanır?: GPT-4, Mixtral 8x7B/8x22B, DeepSeek-V2/V3, Gemini 1.5/2.0 ve Grok-1 MoE mimarisini benimser. 2024-2025 itibarıyla en yetenekli modellerin büyük çoğunluğu MoE tabanlıdır.
- check_circle MoE modellerini yerel olarak çalıştırmak mümkün mü?: Mümkündür; ancak tüm uzmanların bellekte tutulması nedeniyle yüksek VRAM gerekir. Mixtral 8x7B için yaklaşık 48GB VRAM gerekir. Kuantizasyon (GGUF 4-bit) bu gereksinimi önemli ölçüde azaltır; llama.cpp ve Ollama MoE modellerini destekler.