
Açık kaynak LLM seçimi yapacaksanız 2026’da üç isim sürekli karşınıza çıkıyor: Mistral, Llama 4 ve Gemma 3. Her biri farklı bir şirketten, farklı bir mimariden geliyor. Mistral, Avrupa’nın API-odaklı girişimi. Llama 4, Meta’nın açık ağırlık felsefesi. Gemma 3, Google’ın uç cihaz vizyonu. Üçü de aynı anda ekranda göründüğünde “hangisi?” sorusu karmaşıklaşıyor.
Bu yazı o soruya pratik bir cevap veriyor. Benchmark sayıları, VRAM gereksinimleri, API maliyetleri, lisans kısıtları ve Türkçe performans yan yana.
Bu üçlünün farkı ne?
Kısa versiyon: Mistral hız ve verimlilik odaklı, Llama 4 ham kapasite ve çok modlu yetenek odaklı, Gemma 3 ise küçük boyutlarda çalışabilmeye yatırım yaptı.
Mistral (Paris, 2023) en büyük modelini bile API üzerinden servis etmeye yönelik kurdu kendini. Mistral Nemo (12B) ve Mistral Small 3.1 (24B) Apache 2.0 lisansıyla tam açık. Mistral Large (123B) hem API hem indirilebilir ağırlık olarak mevcut, ancak ticari kullanım için ayrı bir lisans gerekiyor.
Llama 4 (Meta, Nisan 2025) Mixture-of-Experts mimarisini benimsedi. Scout 109 milyar toplam, Maverick ise 400 milyar toplam parametreye sahip; her çıkarım adımında yalnızca 17 milyar parametre aktif çalışıyor. Görsel ve metin girdi Scout’ta da mevcut. Meta’nın lisansı 700 milyona kadar kullanıcıya izin veriyor.
Gemma 3 (Google DeepMind, Mart 2025) kompakt boyutlara odaklandı: 27B, 12B, 4B ve 1B varyantlar. Apache 2.0 lisansı kısıtsız ticari kullanıma açık. Tek bir RTX 4090 üzerinde 27B modeli bile çalışıyor; uç cihaz ve mobil dağıtım senaryolarında rakipsiz.
Model ailesi ve parametre karşılaştırması
Her ailenin farklı büyüklük seçenekleri, kullanım senaryosuna göre farklı bir tablo oluşturuyor.
| Model | Parametre (Toplam) | Aktif | Bağlam | Lisans |
|---|---|---|---|---|
| Mistral Nemo | 12B | 12B | 128K | Apache 2.0 |
| Mistral Small 3.1 | 24B | 24B | 128K | Apache 2.0 |
| Mistral Large 2 | 123B | 123B | 128K | MistralAI Ticari |
| Llama 4 Scout | 109B (MoE) | 17B | 10M | Meta Llama 4 |
| Llama 4 Maverick | 400B (MoE) | 17B | 1M | Meta Llama 4 |
| Gemma 3 27B | 27B | 27B | 128K | Apache 2.0 |
| Gemma 3 12B | 12B | 12B | 128K | Apache 2.0 |
| Gemma 3 4B | 4B | 4B | 128K | Apache 2.0 |
Kaynak: Mistral AI teknoloji sayfası, Meta Llama 4, Google Gemma
Llama 4 Scout’un 10 milyon tokenlik bağlam penceresi bu tabloda en çarpıcı rakam. Uzun kod tabanları, büyük doküman koleksiyonları veya çok adımlı ajan zincirleri için bu kapasite doğrudan işe yarıyor. Mistral ve Gemma’nın 128K’sı günlük kullanım için yeterli; ama araştırma veya büyük veri senaryolarında Scout’un farkı hissedilir.
Benchmark ve genel performans
Sayılar bağlam gerektiriyor. MMLU akademik bilgi ölçüyor, GPQA Diamond doktora düzeyinde muhakeme gerektiriyor, ARC-C ise soyut akıl yürütmeyi test ediyor.
| Model | MMLU | GPQA Diamond | ARC-C |
|---|---|---|---|
| Llama 4 Maverick | 85,5 | 65,1 | 89,4 |
| Mistral Large 2 | 84,0 | 59,6 | 88,2 |
| Llama 4 Scout | 79,8 | 58,7 | 83,1 |
| Gemma 3 27B | 74,3 | 55,4 | 80,7 |
| Mistral Small 3.1 | 72,1 | 48,3 | 76,4 |
| Gemma 3 12B | 68,5 | 48,9 | 73,2 |
| Mistral Nemo | 68,0 | 44,7 | 70,8 |
Kaynak: Mistral AI model karşılaştırmaları, Meta Llama 4 teknik raporu, LMSYS Chatbot Arena
Llama 4 Maverick bu tabloda net olarak öne çıkıyor. GPQA Diamond’da 65,1 ile bu listedeki en yüksek skor ona ait. Ama Maverick için gereken donanım pratikte bir engel oluşturuyor; bunu VRAM bölümünde ele alıyoruz.
Mistral Large 2, GPT-4o’nun 2025 başındaki versiyonlarıyla rekabetçi bir bantta çalışıyor. Mistral’ın sunduğu fark performans/maliyet dengesi: bu puanları daha küçük ve daha hızlı bir modelle üretiyor, hem çıkarım gecikmesi hem de API maliyeti açısından.
Akıl yürüten AI modelleri yazısında ele aldığımız gibi, bu benchmark skorları yalnızca temel kapasite gösteriyor. Gerçek üretim performansı, özellikle çok adımlı görevlerde, farklı bir tablo ortaya çıkarıyor.
Kod üretimi
Kodlama senaryoları genel benchmark’lardan ayrışıyor. Mistral’ın özelleştirilmiş kodlama modeli Codestral bu tabloda belirgin.
| Model | HumanEval | MBPP | LiveCodeBench |
|---|---|---|---|
| Codestral (22B) | 91,5 | 78,3 | 43,8 |
| Llama 4 Maverick | 88,0 | 72,1 | 39,4 |
| Mistral Large 2 | 86,3 | 70,8 | 37,2 |
| Llama 4 Scout | 81,3 | 65,4 | 34,1 |
| Mistral Small 3.1 | 69,4 | 56,1 | 27,3 |
| Gemma 3 27B | 72,1 | 58,9 | 29,7 |
| Gemma 3 12B | 65,4 | 51,8 | 24,2 |
Kaynak: Mistral AI teknik blog, Meta AI blog, EvalPlus leaderboard
Codestral 22 milyar parametreyle Llama 4 Maverick’in hemen üzerinde konumlanıyor. Ancak Codestral’ın lisansı ticari kullanımı kısıtlıyor; açık kaynak projeler için uygun, ticari ürünlere entegre etmek için ayrı bir Mistral anlaşması gerekiyor.
Yazılım geliştirme odaklı bir uygulama inşa ediyorsanız Mistral ailesinin pratik çekiciliği burada netleşiyor. Genel amaçlı kullanım için Llama 4 Maverick daha iyi; küçük bir kodlama asistanı için ise Mistral Small 3.1 çok daha verimli çalışıyor.
RAG pipeline’larında model seçimi, /terim/inference aşamasındaki gecikmeyi doğrudan etkiliyor. Kodlama asistanı senaryolarında bu gecikme farkı kullanıcı deneyimine yansıyor.
VRAM ve yerel kurulum
Hangi GPU gerekiyor? Bu, çoğu zaman model seçimini en çok kısıtlayan faktör.
| Model | FP16 VRAM | Q4 VRAM | Öneri |
|---|---|---|---|
| Mistral Large 2 | ~246 GB | ~70 GB | 4x A100 80GB veya 8x RTX 4090 |
| Llama 4 Maverick | ~50 GB etkin | ~26 GB etkin | A100 40GB veya 2x RTX 4090 |
| Mistral Small 3.1 | ~48 GB | ~15 GB | A100 40GB veya 2x RTX 4090 |
| Llama 4 Scout | ~34 GB etkin | ~16 GB etkin | RTX 4090 veya A6000 |
| Gemma 3 27B | ~54 GB | ~16 GB | RTX 4090 veya A5000 |
| Mistral Nemo | ~24 GB | ~8 GB | RTX 4090 veya RTX 4080 Super |
| Gemma 3 12B | ~24 GB | ~8 GB | RTX 3090 veya RTX 4070 Ti |
| Gemma 3 4B | ~8 GB | ~3 GB | RTX 3060 veya Apple M2 |
Kaynak: Ollama model kütüphanesi, HuggingFace model sayfaları
Llama 4’ün MoE mimarisi VRAM konusunda önemli bir avantaj yaratıyor. Maverick’in toplam parametresi 400 milyar, ama her çıkarım adımında yalnızca 17 milyar aktif. Bu, aynı büyüklükte dense bir modele kıyasla çok daha az VRAM tüketimi demek: 2x A100 ile çalıştırabiliyorsunuz, dense 400B için 8x A100 gerekir.
Tek tüketici GPU’nuz varsa seçenekler daralıyor: Mistral Nemo veya Gemma 3 12B RTX 4090 ile çalışıyor. Daha küçük bütçe için Gemma 3 4B M2 MacBook’ta bile çalışıyor.
Yerel LLM kurulum rehberinde ayrıntılı adımları bulabilirsiniz. Hızlı başlamak için:
# Mistral Nemo (12B) — tek RTX 4090 yeterli
ollama run mistral-nemo
# Mistral Small 3.1 (24B) — 2x RTX 4090 veya 48 GB+ VRAM
ollama run mistral-small3.1
# Llama 4 Scout — tek RTX 4090 + geniş RAM (MoE avantajı)
ollama run llama4:scout
# Llama 4 Maverick — 2x RTX 4090 (Q4)
ollama run llama4:maverick
# Gemma 3 27B — Q4 ile tek RTX 4090
ollama run gemma3:27b
# Gemma 3 12B — tek RTX 3090
ollama run gemma3:12b
Scout ile Maverick arasındaki seçim çoğu zaman şuna iniyor: Maverick daha iyi performans, Scout daha az donanım gereksinimi. Kısıtlı bir kurulumda Scout gayet iyi çalışıyor.
API fiyatları ve çalıştırma maliyeti
Kendi GPU’nuz yoksa veya bulut üzerinden servis edecekseniz fiyat farkı belirleyici olabiliyor.
| Model | Input (1M token) | Output (1M token) | Sağlayıcı |
|---|---|---|---|
| Mistral Nemo | $0,10 | $0,10 | Mistral API |
| Mistral Small 3.1 | $0,10 | $0,30 | Mistral API |
| Mistral Large 2 | $2,00 | $6,00 | Mistral API |
| Llama 4 Scout | $0,11 | $0,34 | Together.ai |
| Llama 4 Maverick | $0,20 | $0,85 | Together.ai |
| Gemma 3 12B | $0,10 | $0,30 | Vertex AI |
| Gemma 3 27B | $0,25 | $0,75 | Vertex AI |
Kaynak: Mistral API fiyatlandırma, Together.ai fiyatlandırma, Google Vertex AI fiyatlandırma
Mistral Small 3.1 bu tabloda dikkat çeken bir noktada duruyor. 24 milyar parametreli bir modeli input tarafında $0,10/M token ile sunuyor; Llama 4 Scout ve Gemma 3 12B ile neredeyse aynı fiyat bandında. Mistral’ın kendi API altyapısı üzerinden servis edildiği için gecikme de genellikle düşük.
Yüksek trafikli bir uygulamada Llama 4 Maverick’in $0,85/M output fiyatı hızla birikerek ciddi bir maliyet oluşturabiliyor. Bütçe kısıtı olan ancak iyi genel performans isteyen projelerde Mistral Small 3.1 veya Llama 4 Scout daha mantıklı bir tercih.
OpenRouter vs Together.ai vs Replicate karşılaştırmasında bu modellerin farklı sağlayıcılar üzerindeki fiyatlarını ayrıntılı bulabilirsiniz.
Türkçe ve çok dilli performans
Türkçe içerik üretimi veya çok dilli uygulama geliştiriyorsanız bu karşılaştırma kritik.
Mistral resmi olarak 30’dan fazla dil desteği belirtiyor, ancak Türkçe için özelleştirilmiş eğitim verisi hakkında belge az. Topluluk testleri Mistral Small 3.1’in Türkçe instruction-following konusunda kabul edilebilir sonuçlar verdiğini, ama Llama 4 veya Qwen3 kadar güçlü olmadığını ortaya koyuyor.
Llama 4 Meta’nın 200 dil rakamıyla geliyor. Türkçe için resmi benchmark az; ama Scout’un 10 milyon tokenlik bağlam penceresi uzun Türkçe dokümanlarla çalışmayı pratikte kolaylaştırıyor. Maverick’in genel kapasitesi Türkçe’de de yansıyor.
Gemma 3 140’tan fazla dil desteğini Google’ın çok dilli araştırma birikiminin üzerine inşa etti. Türkçe’de Mistral’a kıyasla biraz daha güvenilir performans raporlanıyor, özellikle 27B varyantında.
Bu üçlü içinde Türkçe NLP projesi için sıralama: Llama 4 Maverick, ardından Gemma 3 27B, ardından Mistral Small 3.1. Bütçe veya donanım kısıtı varsa Gemma 3 12B iyi bir başlangıç noktası.
Lisans ve ticari kullanım
Projenizi ticari bir ürüne dönüştürecekseniz lisans farkı önemli.
Apache 2.0 (Mistral Nemo, Mistral Small 3.1, Gemma 3 tüm varyantlar): ticari kullanım, değiştirme ve dağıtım kısıtsız. En esnek lisans.
Meta Llama 4 lisansı: 700 milyon kullanıcıya kadar izin veriyor. Meta ürünleriyle rekabetçi uygulamalarda kısıtlamalar var. Genel ticari kullanım için çoğu proje için yeterince esnek.
MistralAI ticari lisansı (Mistral Large, Codestral): API üzerinden kullanımda ayrı bir anlaşma gerekiyor. Kodu görüntüleyebiliyorsunuz, ama açık kaynak sayılmıyor.
Startup veya açık kaynak proje için Apache 2.0 lisanslı seçenekler en temiz tercih. Llama 4 büyük ölçekli tüketici ürünleri için genellikle yeterli esnekliği sunuyor.
Hangisini seçmeli?
| Senaryo | Öneri |
|---|---|
| Genel amaçlı, yüksek kalite | Llama 4 Maverick |
| API maliyeti düşük tutmak | Mistral Small 3.1 veya Llama 4 Scout |
| Kodlama asistanı | Codestral (açık kaynak) veya Mistral Small 3.1 (ticari) |
| Tek tüketici GPU, yerel kurulum | Gemma 3 12B veya Mistral Nemo |
| Çok uzun belgeler (128K üstü) | Llama 4 Scout |
| Uç cihaz veya mobil | Gemma 3 4B veya Gemma 3 1B |
| Fine-tuning, özel veri seti | Gemma 3 12B veya Mistral Small 3.1 |
| Google ekosistemi (Vertex AI, JAX) | Gemma 3 |
| Avrupa veri egemenliği | Mistral (Paris merkezli altyapı) |
Mistral’ı seçin: hız, verimlilik ve düşük gecikme öncelikse. Mistral Nemo veya Small 3.1 yerel olarak da çalışıyor; hem API hem self-hosted seçeneği açık.
Llama 4’ü seçin: en yüksek genel performansı istiyorsanız ve Scout’un büyük bağlam penceresine gerçekten ihtiyacınız varsa. MoE mimarisi donanım gereksinimini beklenenden düşük tutuyor.
Gemma 3’ü seçin: kısıtlı donanımda çalışacaksanız, uç cihaz hedefliyorsanız veya Google ekosistemiyle çalışıyorsanız. Apache 2.0 lisansı en kısıtsız ticari kullanıma açık seçenek.
Prompt engineering teknikleri yazısında da belirtildiği gibi, doğru prompt stratejisi bazen model değiştirmekten daha etkili sonuç verebiliyor. Model seçimi ve /terim/quantization ihtiyacı birlikte değerlendirildiğinde, büyük bir modeli prompt’layla yönlendirmek mi yoksa küçük bir modeli fine-tuning ile özelleştirmek mi sorusu çoğu üretim senaryosunda yanıt bulur: donanım kısıtı ve gecikme toleransınız bu kararı netleştiriyor.
Açık kaynak LLM ekosistemi 2026’da hızla olgunlaştı. Bu üç ailenin hepsi kapalı modellere gerçek rakip konumuna geldi. Doğru seçim bütçenize, donanımınıza ve kullanım durumunuza göre değişiyor. Bir yıl önce “açık kaynak mı, kapalı model mi?” sorusu sorulan yerlerde artık “hangi açık kaynak model ve hangi boyut?” sorusu soruluyor.



