tag MixtureOfExperts
Bu sayfada MixtureOfExperts etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
Mistral, 2023 yılında Paris'te kurulan Mistral AI şirketinin geliştirdiği açık ağırlıklı büyük dil modelleri ailesidir. Şirket, kuruluşundan yalnızca birkaç ay sonra Eylül 2023'te yayımladığı 7,3 milyar parametreli **Mistral 7B** ile, açık kaynaklı bir modelin kendi boyut sınıfındaki kapalı alternatifleri geçebileceğini kanıtladı; model o dönem 13B parametreli Llama 2'yi neredeyse tüm karşılaştırma testlerinde geride bıraktı. Mistral'i sektörde ayrıcalıklı kılan iki özellik vardır. Birincisi, **Mixture-of-Experts (MoE)** mimarisini ana akıma taşıyan öncü olmasıdır: Aralık 2023'te çıkan Mixtral 8x7B, her çıkarımda toplam 46,7 milyar parametrenin yalnızca yaklaşık 12,9 milyarını aktive ederek büyük model kapasitesini küçük model maliyetiyle birleştirdi. İkincisi, açık ağırlıklı modellerin **Apache 2.0** lisansıyla dağıtılmasıdır; bu lisans, Meta'nın Llama lisansındaki kullanım kısıtlarının aksine ticari kullanımı koşulsuz serbest bırakır. 2026 itibarıyla portföyün amiral gemisi, 675 milyar toplam ve 41 milyar aktif parametreli MoE modeli **Mistral Large 3**'tür. Aileyi çok modlu **Mistral Small 4**, kurumsal odaklı **Mistral Medium 3.5**, uç cihazlar için tasarlanan kompakt **Ministral 3** serisi, kod modeli **Devstral** ve dokuz dilde konuşma sentezi yapan 4 milyar parametreli **Voxtral TTS** tamamlar. Şirket ayrıca ChatGPT'nin Avrupa'daki en güçlü rakiplerinden biri kabul edilen **Le Chat** asistanını işletir. Modellere üç yoldan erişilir: Le Chat arayüzü, OpenAI uyumlu Mistral API'si (La Plateforme, Amazon Bedrock, Google Vertex AI, Azure AI Foundry) ve açık ağırlıkların Ollama, vLLM veya llama.cpp ile yerel çalıştırılması. Avrupa merkezli tek büyük sınır model laboratuvarı olan Mistral AI; GDPR, AB Yapay Zeka Yasası uyumu ve veri egemenliği arayan kurumlar için doğal bir tercihtir. Şirketin değerlemesi 2025'teki ASML öncülüğündeki 1,7 milyar euroluk yatırım turuyla 11,7 milyar euroya ulaşmıştır.
Mistral (Fransız LLM Ailesi)
Mistral, 2023 yılında Paris'te kurulan Mistral AI şirketinin geliştirdiği açık ağırlıklı büyük dil modelleri ailesidir. Şirket, kuruluşundan yalnızca birkaç ay sonra Eylül 2023'te yayımladığı 7,3 milyar parametreli **Mistral 7B** ile, açık kaynaklı bir modelin kendi boyut sınıfındaki kapalı alternatifleri geçebileceğini kanıtladı; model o dönem 13B parametreli Llama 2'yi neredeyse tüm karşılaştırma testlerinde geride bıraktı. Mistral'i sektörde ayrıcalıklı kılan iki özellik vardır. Birincisi, **Mixture-of-Experts (MoE)** mimarisini ana akıma taşıyan öncü olmasıdır: Aralık 2023'te çıkan Mixtral 8x7B, her çıkarımda toplam 46,7 milyar parametrenin yalnızca yaklaşık 12,9 milyarını aktive ederek büyük model kapasitesini küçük model maliyetiyle birleştirdi. İkincisi, açık ağırlıklı modellerin **Apache 2.0** lisansıyla dağıtılmasıdır; bu lisans, Meta'nın Llama lisansındaki kullanım kısıtlarının aksine ticari kullanımı koşulsuz serbest bırakır. 2026 itibarıyla portföyün amiral gemisi, 675 milyar toplam ve 41 milyar aktif parametreli MoE modeli **Mistral Large 3**'tür. Aileyi çok modlu **Mistral Small 4**, kurumsal odaklı **Mistral Medium 3.5**, uç cihazlar için tasarlanan kompakt **Ministral 3** serisi, kod modeli **Devstral** ve dokuz dilde konuşma sentezi yapan 4 milyar parametreli **Voxtral TTS** tamamlar. Şirket ayrıca ChatGPT'nin Avrupa'daki en güçlü rakiplerinden biri kabul edilen **Le Chat** asistanını işletir. Modellere üç yoldan erişilir: Le Chat arayüzü, OpenAI uyumlu Mistral API'si (La Plateforme, Amazon Bedrock, Google Vertex AI, Azure AI Foundry) ve açık ağırlıkların Ollama, vLLM veya llama.cpp ile yerel çalıştırılması. Avrupa merkezli tek büyük sınır model laboratuvarı olan Mistral AI; GDPR, AB Yapay Zeka Yasası uyumu ve veri egemenliği arayan kurumlar için doğal bir tercihtir. Şirketin değerlemesi 2025'teki ASML öncülüğündeki 1,7 milyar euroluk yatırım turuyla 11,7 milyar euroya ulaşmıştır.
Mixture of Experts Routing Nedir? MoE Yönlendirme Mekanizması (MoE Yönlendirme)
Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. 2017 yılında Shazeer ve arkadaşları tarafından "Outrageously Large Neural Networks" makalesiyle transformer mimarisine entegre edilen bu yaklaşım, GPT-4, Mixtral, DeepSeek ve Gemini gibi önde gelen modellerin temel mimarisi hâline gelmiştir. Geleneksel dense transformer mimarilerinde her token, modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar; ardından en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez. Böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur; bu özellik MoE'yi "sparse" (seyrek) mimari olarak da tanımlar. MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu sorunu önlemek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir. DeepSeek-V3, bu sorunu ek kayıp yerine dinamik bias ayarıyla çözen farklı bir yaklaşım benimsemiştir. Routing iki ana paradigmada gerçekleşir. Token-Choice routing'de her token hangi uzmanı tercih ettiğini seçer; Expert-Choice routing'de ise her uzman belirli tokenleri kendisi alır. İkinci yöntem doğal yük dengesi barındırmakla birlikte bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini beraberinde getirir. 2024-2025 döneminde MoE mimarisi çarpıcı verimlilik göstermiştir: Mixtral 8x7B, 8 uzmanı arasından 2'sini seçerek yaklaşık 47B toplam parametreyle yalnızca 13B aktif parametre kullanır. DeepSeek-V3 ise 256 uzman arasından 8'ini aktive ederek eğitim maliyetini belirgin biçimde azaltmış ve rekabetçi performans elde etmiştir. Bu nedenle MoE, ölçeklenebilir yapay zeka araştırmalarının temel odak noktalarından biri olmayı sürdürmektedir.
Qwen (Alibaba Dil Modeli Ailesi)
Qwen (telaffuz: "Chwen"), Alibaba Group'un DAMO Academy birimi tarafından geliştirilen açık kaynaklı büyük dil modelleri ailesidir. 2023 yılında kamuoyuyla paylaşılan Qwen serisi, hem yoğun (dense) hem de Mixture-of-Experts (MoE) mimarileri kullanarak metin anlama, kod üretimi, matematiksel akıl yürütme ve çok modlu (görüntü, video, ses) işleme yetenekleri sunar. 2026 itibarıyla en güncel modeller Qwen3.7 Max ve Qwen3.7 Plus olup 1 milyon token bağlam penceresi sunmaktadır. Qwen serisi; karmaşık problemler için adım adım düşünen "düşünme modu" (thinking mode) ile hızlı yanıt gerektiren görevler için "diyalog modu" (non-thinking mode) arasında geçiş yapabilme özelliğine sahiptir. Bu ikili mod yaklaşımı, DeepSeek-R1'in popülerleştirdiği ayrım stratejisine paralel şekilde geliştirilmiştir. Qwen ailesi kapsamında özelleşmiş varyantlar bulunmaktadır: akıl yürütme odaklı QwQ modelleri; kod yazmaya özel Qwen-Coder; görsel algılama için Qwen-VL; ses işleme için Qwen-Audio; matematik çözme için Qwen-Math. Modeller Apache 2.0 veya Qwen lisansı altında Hugging Face'te yayımlanmaktadır. Türkçe dahil 100'den fazla dili destekleyen Qwen, Hugging Face Open LLM Leaderboard başta olmak üzere birçok kıyaslamada Meta'nın Llama serisi ve Google'ın Gemma'sıyla rekabet edebilir puanlar almıştır. Özellikle Qwen-Coder 2.5 modeli, HumanEval ve MBPP gibi kod kıyaslamalarında Llama-70B düzeyinde performans göstererek dikkat çekmiştir. Geliştiriciler için Qwen'in temel çekiciliği maliyet-verimlilik dengesindedir: MoE mimarisi, aynı parametre boyutundaki dense modellere kıyasla çok daha az hesaplama kaynağıyla çalışır. Yerelde Ollama veya LM Studio gibi araçlarla donanım kısıtları olan ortamlarda dahi barındırılabilen küçük versiyonları (0.5B–7B) mevcuttur. Alibaba Cloud API (DashScope) üzerinden de erişilebilen Qwen, Together AI ve OpenRouter gibi platformlarda da listelenmektedir. Açık ağırlık stratejisi ve geniş dil desteğiyle Qwen, küresel ölçekte kurumsal yapay zeka projelerinde Meta Llama'ya ciddi bir alternatif konumuna gelmiştir. Qwen'in eğitim sürecinde kullanılan veri karmasında çok dilli içerik ağırlıklı olarak yer almaktadır. Özellikle Qwen2.5 serisinde Türkçe dahil düşük kaynaklı diller için ayrıca özel ince-ayar (fine-tuning) veri setleri kullanılarak dil performansı iyileştirilmiştir. Bu süreç, modelin Türkçe bağlamı anlama ve tutarlı yanıt üretme becerisini güçlendirmektedir.