list_altİçindekilerexpand_more
- 01Neden Bu Üç Model?
- 02Benchmark Karşılaştırması
- 03Çok Dilli Destek ve Türkçe
- 04Donanım ve Çalıştırma Gereksinimleri
- 05Ollama ile Yerel Çalıştırma
- 06Kullanım Senaryoları
- 07Llama 4 için ideal görevler
- 08Qwen3 için ideal görevler
- 09Gemma 3 için ideal görevler
- 10Genel Karşılaştırma Tablosu
- 11Hangi Proje İçin Hangisi?

400 milyar parametreli kapalı modeller yerine açık kaynak kullanacaksanız, 2026’da üç isim sürekli karşınıza çıkıyor: Meta Llama 4, Alibaba Qwen3 ve Google Gemma 3. Her biri farklı bir mimariden geliyor, ama hedefledikleri yer aynı: kendi altyapınızda çalışan, genel amaçlı bir dil modeli. Hangisi projenize uyuyor?
Bu yazı benchmark tablolarını ve donanım gereksinimlerini yan yana koyarak o soruya cevap veriyor.
Neden Bu Üç Model?
Açık kaynak LLM ekosistemi 2025 sonunda ciddi bir dönüm noktasına geldi; kapalı modellere gerçekten yaklaşan ilk açık alternatifler bu dönemde çıktı. Bu kalabalık arasından üç aile öne geçiyor.
Meta Llama 4 (Nisan 2026) MoE mimarisini temel alan bir aile. Scout varyantı 109 milyar, Maverick 400 milyar toplam parametre taşıyor; her çıkarım adımında yalnızca 17 milyar aktif. Hesaplama verimliliği bu yapıdan geliyor.
Alibaba Qwen3 (Mayıs 2026) Apache 2.0 lisansıyla yayınlanan en güçlü açık model. 235 milyar parametreli MoE versiyonunun 22 milyar aktif parametresi var. 32B, 14B, 7B ve daha küçük varyantlar ticari projeler için kısıtsız kullanılabilir.
Google Gemma 3 (Mart 2026) Kompakt boyutlara odaklanan bir aile; 27B, 12B, 4B ve 1B versiyonlar mevcut. 128K context penceresi, görüntü anlama ve uç cihazlarda çalışabilme bu ailede öne çıkıyor.
Doğru soru “hangisi en iyi?” değil, “benim kullanım durumum için hangisi daha iyi?”
Benchmark Karşılaştırması
Sayılar tek başına bir şey anlatmaz, ama nereden başlayacağınızı gösterir.
| Model | MMLU | HumanEval | MATH | GPQA Diamond |
|---|---|---|---|---|
| Qwen3-235B-A22B | 87,4 | 92,1 | 85,3 | 68,2 |
| Llama 4 Maverick | 85,5 | 88,0 | 78,6 | 65,1 |
| Llama 4 Scout | 79,8 | 81,3 | 72,4 | 58,7 |
| Gemma 3-27B | 74,3 | 72,1 | 68,9 | 55,4 |
| Gemma 3-12B | 68,5 | 65,4 | 61,2 | 48,9 |
Qwen3-235B bu tabloda belirgin şekilde önde. MMLU, HumanEval ve MATH’ın hepsinde en yüksek skor ona ait. 235 milyar toplam parametre olmasına karşın her çıkarımda yalnızca 22 milyar aktif çalışıyor; bellek gereksinimi tam 235B’lık bir modelden çok daha düşük.
Llama 4 Maverick, GPT-4o’nun 2025 başındaki sürümlerine yakın bir bantla çalışıyor. Llama 4’ü ayrıntılı inceleyen yazımızda ele aldığımız çok modlu yetenekleri de hesaba katınca tablo biraz daha karmaşıklaşıyor; görsel girdi işleyebilmesi rakipleri üzerinde net bir avantaj.
Gemma 3-27B rakamları ilk bakışta mütevazı. Ama güçlü yönü başka yerde: tek RTX 4090’da çalışıyor, fine-tuning için yeterince kapasiteli bir base model sunuyor, Google’ın araştırma ekosistemine entegre.
Çok Dilli Destek ve Türkçe
Türkçe içerik ya da çok dilli uygulama geliştiriyorsanız bu karşılaştırma kritik.
Qwen3 resmi olarak 100’den fazla dil destekliyor. Alibaba’nın çok dilli birikimi Türkçe’de de iyi çalışıyor; instruction-following kalitesi İngilizce ile kıyaslandığında belirgin bir düşüş göstermiyor.
Llama 4 için Meta 200 dil rakamını açıkladı, ancak Türkçe’ye özgü belgelenmiş kıyaslama az. Scout’un 10 milyon tokenlik bağlam penceresi uzun Türkçe dokümanlarla çalışırken işe yarıyor.
Gemma 3 için 140’tan fazla dil var. İnce ayar veri setleri İngilizce ağırlıklı olsa da Gemma 3-27B Türkçe’de kabul edilebilir sonuçlar veriyor.
Türkçe NLP projesi için öncelik sırası: Qwen3, ardından Llama 4 Maverick, ardından Gemma 3. Bütçe veya donanım kısıtı varsa Gemma 3-12B iyi bir başlangıç noktası.
Donanım ve Çalıştırma Gereksinimleri
“Hangi GPU gerekiyor?” sorusu en sık karşılaşılan pratik engel.
| Model | FP16 VRAM | 4-bit Q4 VRAM | Öneri |
|---|---|---|---|
| Qwen3-235B-A22B | ~470 GB | ~130 GB | 2x A100 80GB veya dağıtık kurulum |
| Qwen3-32B | ~64 GB | ~20 GB | A100 80GB veya 4x RTX 4090 |
| Llama 4 Maverick | ~50 GB etkin | ~26 GB etkin | A100 40GB veya 2x RTX 4090 |
| Llama 4 Scout | ~34 GB etkin | ~16 GB etkin | RTX 4090 veya A6000 |
| Gemma 3-27B | ~54 GB | ~16 GB | RTX 4090 veya A5000 |
| Gemma 3-12B | ~24 GB | ~8 GB | RTX 3090 veya RTX 4070 Ti |
| Gemma 3-4B | ~8 GB | ~3 GB | RTX 3060 veya Apple M2 |
MoE modeller için iki rakamı birbirinden ayırt etmek gerekiyor. Llama 4 Maverick’in 400 milyar toplam parametresi her çıkarımda aktif değil. Ama model ağırlıklarını bellekte tutmak için hepsini yüklüyorsunuz; çıkarım sırasında yalnızca 17 milyar aktif çalışıyor. Tablodaki “etkin VRAM” bu farkı yansıtıyor.
Quantization formatları olan GGUF, AWQ ve GPTQ arasındaki farkları anlatan yazımız hangi formatta indirmeniz gerektiğine dair pratik bir kılavuz sunuyor.
Ollama ile Yerel Çalıştırma
Hızlı kurulum için Ollama en az adımla başlamayı mümkün kılıyor. Küçük Gemma ve Qwen3 varyantları tek komutla çalışıyor:
# Gemma 3 27B — RTX 4090'da 4-bit varsayılan
ollama run gemma3:27b
# Qwen3 32B — A100 80GB veya çift RTX 4090
ollama run qwen3:32b
# Llama 4 Scout — 16 GB VRAM yeterli (4-bit)
ollama run llama4:scout
Ollama kurulumu ve yerel LLM çalıştırmayı adım adım anlatan rehberimiz tüm kurulum adımlarını kapsıyor.
Qwen3’ün thinking mode özelliği etkinleştirilince model karmaşık bir soruya adım adım akıl yürüterek yanıt üretiyor. Yoğun matematik veya kod analizi görevlerinde bu mod kapalı modellere oldukça yakın sonuçlar veriyor:
import ollama
response = ollama.chat(
model="qwen3:32b",
messages=[
{
"role": "user",
"content": "Bu fonksiyonun zaman karmaşıklığını analiz et ve optimize et: def find_duplicates(lst): return [x for x in lst if lst.count(x) > 1]"
}
],
options={
"temperature": 0.6,
"top_p": 0.95
}
)
print(response["message"]["content"])
OpenAI uyumlu uç nokta üzerinden Llama 4 Scout’u kullanmak için:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama"
)
completion = client.chat.completions.create(
model="llama4:scout",
messages=[
{
"role": "system",
"content": "Sen uzman bir Python geliştiricisisin."
},
{
"role": "user",
"content": "RAG sistemi için vektör veritabanı seçiminde nelere dikkat etmeliyim?"
}
]
)
print(completion.choices[0].message.content)
Kullanım Senaryoları
Llama 4 için ideal görevler
Scout’un 10 milyon tokenlik bağlam penceresi açık kaynak dünyasında eşsiz bir kapasite. Büyük bir kod tabanını, bir kitabı ya da yüzlerce sayfalık teknik bir dokümanı tek istekte işleyebilmek, belge analizi ve kod inceleme süreçlerinde ciddi bir fark yaratıyor.
Maverick hem görüntü anlıyor hem de metin üretiyor. Belge tarama, tablo okuma ve şema analizi için ayrı bir vision modeli tutmak yerine tek modelle gidebilirsiniz.
Llama ailesinin yıllardır biriken popülerliği geniş bir fine-tune kütüphanesi oluşturdu. HuggingFace’te alan spesifik model bulmak Qwen3 veya Gemma 3’e kıyasla çok daha kolay; hızlı prototip için bu önemli.
Qwen3 için ideal görevler
HumanEval ve MATH’ta Qwen3-235B diğerlerinden belirgin şekilde ayrışıyor. Kod tamamlama, hata ayıklama ve algoritma analizi gerektiren işlerde şu an açık kaynak en güçlü seçenek bu model.
Qwen3’ün thinking mode’u karmaşık problemlerde zincir halinde düşünme adımları üretiyor. Akıl yürüten AI modellerini incelediğimiz yazıda ele aldığımız test-time compute yaklaşımına benzer şekilde, bu mod hukuk metni analizi, araştırma özetleme ve çok adımlı planlama görevlerinde kalite farkı yaratıyor.
Llama ve Gemma’nın ticari lisans kısıtlamaları var; Qwen3, Apache 2.0 ile bu engeli tamamen kaldırıyor. Ticari bir SaaS ürünü geliştiriyorsanız bu ayrım karar verici olabilir.
Gemma 3 için ideal görevler
Gemma 3-4B bir Apple M2 Mac’te sorunsuz çalışıyor. Sunucu maliyetini düşük tutmak isteyen girişimler ve mobil entegrasyon için Gemma 3’ün küçük varyantları pratik.
Alan spesifik ince ayar için küçük ama sağlam bir başlangıç modeli önemli. Fine-tuning ve RAG arasında strateji seçimini anlatan yazımızda belirttiğimiz gibi, domain spesifik ince ayar için Gemma 3-12B iyi bir başlangıç; büyük değil ama ince ayar sonrası kullanışlı bir modele dönüşüyor.
Gemma lisansı araştırma kullanımında geniş bir özgürlük tanıyor. Google DeepMind’ın düzenli checkpoint yayını ve akademik toplulukla entegrasyonu araştırma projeleri için artı.
Genel Karşılaştırma Tablosu
| Kriter | Llama 4 Scout | Llama 4 Maverick | Qwen3-235B | Gemma 3-27B |
|---|---|---|---|---|
| Toplam / Aktif Param. | 109B / 17B | 400B / 17B | 235B / 22B | 27B / 27B |
| Bağlam Penceresi | 10M token | 1M token | 32K token | 128K token |
| Görüntü Anlama | Hayır | Evet | Hayır | Evet |
| Genel Benchmark | orta-iyi | iyi | çok iyi | orta |
| Türkçe Desteği | orta | iyi | çok iyi | orta |
| Min. VRAM (4-bit) | ~16 GB | ~26 GB | ~130 GB (full) | ~16 GB |
| Lisans | Llama 4 Community | Llama 4 Community | Apache 2.0 | Gemma |
| Ticari Serbestlik | Kısıtlı* | Kısıtlı* | Tam serbest | Kısıtlı* |
| Fine-tuning Ekosistemi | Çok geniş | Geniş | Büyüyor | Orta |
*Llama 4 Community License, aylık 700 milyondan fazla aktif kullanıcısı olan servisler için Meta onayı gerektiriyor.
Hangi Proje İçin Hangisi?
Karar ağacı şöyle özetlenebilir.
Qwen3-235B veya Qwen3-32B tercih edin:
- Ticari kullanım için Apache 2.0 lisansı şartsa
- Kodlama, matematik veya karmaşık akıl yürütme önceliğinizse
- A100 sınıfı donanım ya da bulut bütçeniz varsa
- Küçük varyantlarla (7B, 4B) prodüksiyon maliyetini düşürmek istiyorsanız
Llama 4 Maverick veya Scout seçin:
- Uzun bağlam penceresi kritikse (Scout ile 10M token’a kadar)
- Görüntü ve metin işleyen tek bir modele ihtiyaç duyuyorsanız
- Llama fine-tune ekosistemi önemliyse
- Meta altyapı desteğini değerlendiriyorsanız
Gemma 3-27B veya alt varyantlar seçin:
- GPU bütçeniz 16 GB VRAM veya altındaysa
- Alan spesifik fine-tuning yapacaksanız ve hafif bir base model yeterliyse
- Araştırma veya prototip hızı önceliğinizse
- Edge veya mobil entegrasyon planlıyorsanız
Kimi K2 ve Qwen3’ün kodlama kıyaslamasını ele aldığımız yazıda gerçek proje ölçeğinde test sonuçları da mevcut; farklı kod görevlerinde hangisinin öne çıktığını orada görebilirsiniz.
2026’da açık kaynak LLM seçimi artık tek boyutlu bir tercih değil. Donanım, lisans, çok dilli destek ve bağlam penceresi kapasitesi birlikte değerlendirilmeli. Her üç modelin güçlü olduğu farklı senaryolar var; asıl tuzak yanlış senaryoda yanlış modeli kullanmak.



