tag MixtureOfExperts

Bu sayfada MixtureOfExperts etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.

Mistral, 2023 yılında Paris'te kurulan Mistral AI şirketinin geliştirdiği açık ağırlıklı büyük dil modelleri ailesidir. Şirket, kuruluşundan yalnızca birkaç ay sonra Eylül 2023'te yayımladığı 7,3 milyar parametreli **Mistral 7B** ile, açık kaynaklı bir modelin kendi boyut sınıfındaki kapalı alternatifleri geçebileceğini kanıtladı; model o dönem 13B parametreli Llama 2'yi neredeyse tüm karşılaştırma testlerinde geride bıraktı. Mistral'i sektörde ayrıcalıklı kılan iki özellik vardır. Birincisi, **Mixture-of-Experts (MoE)** mimarisini ana akıma taşıyan öncü olmasıdır: Aralık 2023'te çıkan Mixtral 8x7B, her çıkarımda toplam 46,7 milyar parametrenin yalnızca yaklaşık 12,9 milyarını aktive ederek büyük model kapasitesini küçük model maliyetiyle birleştirdi. İkincisi, açık ağırlıklı modellerin **Apache 2.0** lisansıyla dağıtılmasıdır; bu lisans, Meta'nın Llama lisansındaki kullanım kısıtlarının aksine ticari kullanımı koşulsuz serbest bırakır. 2026 itibarıyla portföyün amiral gemisi, 675 milyar toplam ve 41 milyar aktif parametreli MoE modeli **Mistral Large 3**'tür. Aileyi çok modlu **Mistral Small 4**, kurumsal odaklı **Mistral Medium 3.5**, uç cihazlar için tasarlanan kompakt **Ministral 3** serisi, kod modeli **Devstral** ve dokuz dilde konuşma sentezi yapan 4 milyar parametreli **Voxtral TTS** tamamlar. Şirket ayrıca ChatGPT'nin Avrupa'daki en güçlü rakiplerinden biri kabul edilen **Le Chat** asistanını işletir. Modellere üç yoldan erişilir: Le Chat arayüzü, OpenAI uyumlu Mistral API'si (La Plateforme, Amazon Bedrock, Google Vertex AI, Azure AI Foundry) ve açık ağırlıkların Ollama, vLLM veya llama.cpp ile yerel çalıştırılması. Avrupa merkezli tek büyük sınır model laboratuvarı olan Mistral AI; GDPR, AB Yapay Zeka Yasası uyumu ve veri egemenliği arayan kurumlar için doğal bir tercihtir. Şirketin değerlemesi 2025'teki ASML öncülüğündeki 1,7 milyar euroluk yatırım turuyla 11,7 milyar euroya ulaşmıştır.

wind_power

Mistral (Fransız LLM Ailesi)

Mistral, 2023 yılında Paris'te kurulan Mistral AI şirketinin geliştirdiği açık ağırlıklı büyük dil modelleri ailesidir. Şirket, kuruluşundan yalnızca birkaç ay sonra Eylül 2023'te yayımladığı 7,3 milyar parametreli **Mistral 7B** ile, açık kaynaklı bir modelin kendi boyut sınıfındaki kapalı alternatifleri geçebileceğini kanıtladı; model o dönem 13B parametreli Llama 2'yi neredeyse tüm karşılaştırma testlerinde geride bıraktı. Mistral'i sektörde ayrıcalıklı kılan iki özellik vardır. Birincisi, **Mixture-of-Experts (MoE)** mimarisini ana akıma taşıyan öncü olmasıdır: Aralık 2023'te çıkan Mixtral 8x7B, her çıkarımda toplam 46,7 milyar parametrenin yalnızca yaklaşık 12,9 milyarını aktive ederek büyük model kapasitesini küçük model maliyetiyle birleştirdi. İkincisi, açık ağırlıklı modellerin **Apache 2.0** lisansıyla dağıtılmasıdır; bu lisans, Meta'nın Llama lisansındaki kullanım kısıtlarının aksine ticari kullanımı koşulsuz serbest bırakır. 2026 itibarıyla portföyün amiral gemisi, 675 milyar toplam ve 41 milyar aktif parametreli MoE modeli **Mistral Large 3**'tür. Aileyi çok modlu **Mistral Small 4**, kurumsal odaklı **Mistral Medium 3.5**, uç cihazlar için tasarlanan kompakt **Ministral 3** serisi, kod modeli **Devstral** ve dokuz dilde konuşma sentezi yapan 4 milyar parametreli **Voxtral TTS** tamamlar. Şirket ayrıca ChatGPT'nin Avrupa'daki en güçlü rakiplerinden biri kabul edilen **Le Chat** asistanını işletir. Modellere üç yoldan erişilir: Le Chat arayüzü, OpenAI uyumlu Mistral API'si (La Plateforme, Amazon Bedrock, Google Vertex AI, Azure AI Foundry) ve açık ağırlıkların Ollama, vLLM veya llama.cpp ile yerel çalıştırılması. Avrupa merkezli tek büyük sınır model laboratuvarı olan Mistral AI; GDPR, AB Yapay Zeka Yasası uyumu ve veri egemenliği arayan kurumlar için doğal bir tercihtir. Şirketin değerlemesi 2025'teki ASML öncülüğündeki 1,7 milyar euroluk yatırım turuyla 11,7 milyar euroya ulaşmıştır.

arrow_forward
🔀

Mixture of Experts Routing (MoE Yönlendirme)

Mixture of Experts (MoE) routing, modern büyük dil modellerinde her transformer katmanının feed-forward bloğunu birden fazla "uzman" alt ağa bölen ve her gelen token için yalnızca belirli uzmanları etkinleştiren bir yönlendirme mekanizmasıdır. 2017 yılında Shazeer ve arkadaşları tarafından "Outrageously Large Neural Networks" makalesiyle transformer mimarisine entegre edilen bu yaklaşım, GPT-4, Mixtral, DeepSeek ve Gemini gibi önde gelen modellerin temel mimarisi hâline gelmiştir. Geleneksel dense transformer mimarilerinde her token, modelin tüm parametrelerinden geçer; bu durum ölçeklendirme maliyetini parametrelerle orantılı biçimde artırır. MoE mimarisinde ise öğrenilebilir bir yönlendirici (router) ağı, her token için uzmanlar arası bir ağırlık vektörü hesaplar; ardından en yüksek ağırlıklı K uzmanı seçer ve hesaplamayı yalnızca bu uzmanlara yönlendirir. Geri kalan uzmanlar o token için hiç etkinleştirilmez. Böylece toplam parametre sayısı büyük kalırken token başına hesaplama maliyeti sabit tutulur; bu özellik MoE'yi "sparse" (seyrek) mimari olarak da tanımlar. MoE routing'in en önemli pratik sorunu "router collapse"dır: yeterli düzenleme eklenmediğinde router tüm tokenleri yalnızca 1-2 uzmana yönlendirmeye başlar ve geri kalan uzmanlar boşta kalır. Bu sorunu önlemek için eğitim kaybına yük dengeleme kaybı (auxiliary load balancing loss) eklenir. DeepSeek-V3, bu sorunu ek kayıp yerine dinamik bias ayarıyla çözen farklı bir yaklaşım benimsemiştir. Routing iki ana paradigmada gerçekleşir. Token-Choice routing'de her token hangi uzmanı tercih ettiğini seçer; Expert-Choice routing'de ise her uzman belirli tokenleri kendisi alır. İkinci yöntem doğal yük dengesi barındırmakla birlikte bazı tokenlerin hiçbir uzman tarafından seçilmeme riskini beraberinde getirir. 2024-2025 döneminde MoE mimarisi çarpıcı verimlilik göstermiştir: Mixtral 8x7B, 8 uzmanı arasından 2'sini seçerek yaklaşık 47B toplam parametreyle yalnızca 13B aktif parametre kullanır. DeepSeek-V3 ise 256 uzman arasından 8'ini aktive ederek eğitim maliyetini belirgin biçimde azaltmış ve rekabetçi performans elde etmiştir. Bu nedenle MoE, ölçeklenebilir yapay zeka araştırmalarının temel odak noktalarından biri olmayı sürdürmektedir.

arrow_forward
psychology_alt

Qwen (Alibaba Dil Modeli Ailesi)

Qwen (通义千问), Alibaba Group'un geliştirdiği ve sürekli güncellenen büyük dil modeli serisidir. "Tongyi Qianwen" adının kısaltması olan Qwen, 2023'te kamuya açılan ilk sürümlerinden bu yana hem kapalı hem açık kaynak modeller sunarak küresel LLM pazarında Çin kökenli alternatiflerin en güçlü temsilcilerinden biri konumuna geldi. Model ailesi birkaç bölümde incelenir: **Qwen-Max/Plus/Turbo** sürümleri Alibaba Cloud üzerinden API olarak sunulan kapalı kaynak modellerdir; farklı hız-kalite-maliyet dengesine göre seçilebilir. **Qwen2 ve Qwen2.5** serisi ise 0.5B'dan 72B parametreye kadar uzanan açık kaynak modellerdir; Hugging Face'de yayımlanmış ve ince ayar topluluğu tarafından yaygın biçimde kullanılmaktadır. **Qwen-VL**, görüntü ve metin girdisini birleştiren çok modlu sürümdür. **Qwen-Coder** ve **QwQ** ise sırasıyla kod üretimi ve akıl yürütme (reasoning) için optimize edilmiş özel modeller olarak öne çıkar; QwQ, DeepSeek-R1 ile birlikte açık kaynak reasoning model yarışının önemli oyuncusu hâline geldi. Teknik özellikler açısından Qwen modelleri Grouped Query Attention (GQA) ve Rotary Position Embedding (RoPE) gibi modern Transformer iyileştirmelerini benimser; uzun bağlam penceresi (bazı sürümlerde 128K token) kurumsal belge analizine olanak tanır. Çince ve İngilizce'de güçlü performansıyla bilinmesinin yanı sıra çok dilli destek kapsamı giderek genişlemektedir. Lisanslama açısından Qwen2 ve Qwen2.5 serisi Tongyi Qianwen Lisansı altında yayımlanmakta olup bazı sürümler Apache 2.0 altında tamamen özgür kullanım sunar; bu durum kurumsal benimsemeyi kolaylaştırmaktadır. Ollama, LM Studio ve vLLM gibi çerçeveler Qwen modellerini yerel olarak çalıştırmayı desteklemektedir. Qwen modelleri Türkiye gibi gelişmekte olan yapay zeka ekosistemlerinde dikkat çekmektedir: açık kaynak statüsü, geniş dil desteği ve görece düşük çalıştırma maliyeti kurumsal benimsemeyi kolaylaştırmaktadır. 2026 itibarıyla Qwen2.5-Max sürümü MMLU ve GPQA gibi akademik karşılaştırmalarda Batı kaynaklı modellere yakın puanlar almaktadır.

arrow_forward