Mixture of Experts Routing Nedir? MoE Yönlendirme Mekanizması (MoE Yönlendirme)

MoE mimarisinde her tokeni en uygun uzman alt ağlara yönlendiren öğrenilebilir kapı (gate) fonksiyonu.

Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. 2017 yılında Shazeer ve arkadaşları tarafından "Outrageously Large Neural Networks" makalesiyle transformer mimarisine entegre edilen bu yaklaşım, GPT-4, Mixtral, DeepSeek ve Gemini gibi önde gelen modellerin temel mimarisi hâline gelmiştir. Geleneksel dense transformer mimarilerinde her token, modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar; ardından en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez. Böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur; bu özellik MoE'yi "sparse" (seyrek) mimari olarak da tanımlar. MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu sorunu önlemek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir. DeepSeek-V3, bu sorunu ek kayıp yerine dinamik bias ayarıyla çözen farklı bir yaklaşım benimsemiştir. Routing iki ana paradigmada gerçekleşir. Token-Choice routing'de her token hangi uzmanı tercih ettiğini seçer; Expert-Choice routing'de ise her uzman belirli tokenleri kendisi alır. İkinci yöntem doğal yük dengesi barındırmakla birlikte bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini beraberinde getirir. 2024-2025 döneminde MoE mimarisi çarpıcı verimlilik göstermiştir: Mixtral 8x7B, 8 uzmanı arasından 2'sini seçerek yaklaşık 47B toplam parametreyle yalnızca 13B aktif parametre kullanır. DeepSeek-V3 ise 256 uzman arasından 8'ini aktive ederek eğitim maliyetini belirgin biçimde azaltmış ve rekabetçi performans elde etmiştir. Bu nedenle MoE, ölçeklenebilir yapay zeka araştırmalarının temel odak noktalarından biri olmayı sürdürmektedir.

MoE Routing Nedir?

Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. Geleneksel dense mimarilerinde her token modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar, ardından softmax fonksiyonuyla en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez; böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur. Bu özellik, MoE'yi "sparse" (seyrek) mimari olarak da tanımlar.

Gate Fonksiyonu ve Top-K Seçimi

Router ağı genellikle bir softmax kapı fonksiyonu ile çalışır: giriş tokeninin gömme vektörüne (embedding) küçük bir projeksiyon matrisi uygulanır ve her uzman için bir ağırlık üretilir. En yüksek ağırlıklı K uzman seçilir; seçilen uzmanların çıktıları ağırlıklı ortalama ile birleştirilir. Mixtral 8x7B mimarisinde 8 uzman bulunur ve her token için 2'si seçilir; böylece yaklaşık 13B aktif parametre ile 47B toplam parametre kapasitesi ayrışır. DeepSeek-V3'te ise 256 uzman arasından 8'i seçilir — bu yapı hem kapasiteyi hem uzmanlaşmayı derinleştirir. K değeri genellikle 2 ile 8 arasında tutulur; daha yüksek K daha fazla hesaplama maliyeti ancak daha zengin temsil anlamına gelir.

Yük Dengeleme ve Router Collapse

MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router, tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu durum model kapasitesini etkin biçimde düşürür ve donanım verimliliğini bozar. Önüne geçmek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir; bu ek kayıp uzmanların tüm tokenlere eşit dağılmasını teşvik eder. DeepSeek-V3, bu sorunu "auxiliary-loss-free load balancing" yöntemiyle farklı bir açıdan çözer: ek kayıp yerine yönlendirici biasını dinamik biçimde ayarlar. Yük dengeleme aynı zamanda GPU'lar arası bant genişliğini verimli kullanmak açısından da kritiktir.

Token-Choice ve Expert-Choice Routing

  • check_circle Token-Choice Routing: Her token hangi uzman(lar)ı tercih ettiğini seçer. En yaygın paradigma olmakla birlikte router collapse riski taşır ve eğitimde yük dengeleme kaybı gerektirir. Mixtral ve GPT-4 bu yaklaşımı benimser.
  • check_circle Expert-Choice Routing: Her uzman işleyeceği token kümesini kendisi seçer; belirli bir kapasite sınırına kadar en yüksek ağırlıklı tokenleri alır. Doğal yük dengesi sunar; ancak bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini barındırır.

Avantajlar ve Kısıtlamalar

  • check_circle Büyük kapasite, sabit maliyet: Dense modele kıyasla 4-8× daha büyük toplam parametre kapasitesi, token başına sabit FLOP maliyetiyle elde edilir.
  • check_circle Uzman uzmanlaşması: Farklı uzmanlar farklı dil kalıpları veya bilgi alanlarında uzmanlaşabilir; bu durum modelin genel kapasitesini artırır.
  • check_circle Eğitim verimliliği: Aynı eğitim bütçesiyle dense modele göre daha yüksek kalite elde edilir. DeepSeek-V3, GPT-4 seviyesi performansı belirgin biçimde daha düşük maliyetle sunmuştur.
  • check_circle Yüksek VRAM gereksinimi: Aktif olmayan uzmanlar da bellekte tutulur; MoE modelleri benzer performanstaki dense modellere göre çok daha fazla GPU belleği gerektirir.
  • check_circle Karmaşık eğitim dinamiği: Router collapse riski, yük dengeleme hiperparametreleri ve uzman kapasite sınırlamaları eğitimi zorlaştırır; dikkatli ayar ve izleme gerektirir.

Sık Sorulan Sorular

  • check_circle MoE routing neden dense modellere göre daha verimlidir?: Dense modeller her token için tüm parametreleri hesaplar; MoE ise token başına yalnızca seçili K uzmanı etkinleştirir. Toplam parametre büyük tutulurken hesaplama maliyeti sabit kalır; aynı FLOP bütçesiyle çok daha derin bilgi kapasitesi elde edilir.
  • check_circle Router collapse nedir ve nasıl önlenir?: Router collapse, yönlendiricinin tüm tokenleri yalnızca birkaç uzmana göndermesi ve diğer uzmanların atıl kalmasıdır. Yük dengeleme kaybı (auxiliary loss) veya DeepSeek-V3'te kullanılan dinamik bias ayarı bu sorunu önlemek için kullanılır.
  • check_circle Top-K değeri nasıl belirlenir?: Mixtral gibi modeller K=2, DeepSeek-V3 K=8 kullanır. Düşük K daha az hesaplama maliyeti sunar; yüksek K daha zengin temsil ancak daha fazla kaynak gerektirir. Araştırmalar çoğu görev için K=2'nin iyi bir başlangıç noktası olduğunu göstermektedir.
  • check_circle MoE mimarisini hangi modeller kullanır?: GPT-4, Mixtral 8x7B/8x22B, DeepSeek-V2/V3, Gemini 1.5/2.0 ve Grok-1 MoE mimarisini benimser. 2024-2025 itibarıyla en yetenekli modellerin büyük çoğunluğu MoE tabanlıdır.
  • check_circle MoE modellerini yerel olarak çalıştırmak mümkün mü?: Mümkündür; ancak tüm uzmanların bellekte tutulması nedeniyle yüksek VRAM gerekir. Mixtral 8x7B için yaklaşık 48GB VRAM gerekir. Kuantizasyon (GGUF 4-bit) bu gereksinimi önemli ölçüde azaltır; llama.cpp ve Ollama MoE modellerini destekler.