list_altİçindekilerexpand_more
- 01Neden Yerel LLM? Hızlı Arka Plan
- 021. Ollama — En Popüler, En Kolay CLI Aracı
- 032. LM Studio — Teknik Olmayan Kullanıcılar İçin En İyi GUI
- 043. vLLM — Yüksek Verimli Üretim Sunucusu
- 054. llama.cpp — Her Şeyin Temeli
- 065. GPT4All — Offline Masaüstü Uygulaması
- 076. Open WebUI — Ollama için Tarayıcı Arayüzü
- 087. Jan.ai — Açık Kaynak ChatGPT Masaüstü Alternatifi
- 09Hangi Aracı Seçmeli? Karar Ağacı
- 10Donanım Gereksinimleri Özeti
- 11Pratik Başlangıç: 5 Dakikada Yerel LLM
- 12Sonuç
2024 başında yerel bir LLM çalıştırmak “hacker’a mahsus” bir aktiviteydi. Terminalde onlarca parametre, elle derleme, çöküp duran Python ortamları. 2026’da tablo tamamen değişti: birkaç komutla ya da birkaç tıklamayla Llama 4, Qwen 3, Mistral ve onlarca başka model kendi bilgisayarınızda çalışıyor.
Ama seçenek fazlalığı yeni bir sorun yarattı: Ollama mı, LM Studio mu, vLLM mi? Her araç farklı bir kullanıcı profiline, farklı bir donanım gereksinimine ve farklı bir kullanım senaryosuna hitap ediyor. Yanlış aracı seçmek, mükemmel bir modeli bile hayal kırıklığına dönüştürebilir.
Bu rehberde 2026’nın yedi öne çıkan açık kaynak yerel LLM aracını gerçek kullanım senaryolarıyla, donanım gereksinimlerini açık açık söyleyerek ve birbiriyle kıyaslayarak ele alıyoruz.

Neden Yerel LLM? Hızlı Arka Plan
Bulut tabanlı yapay zekaların iki büyük dezavantajı var: gizlilik ve maliyet. Her mesaj OpenAI, Anthropic ya da Google’ın sunucularından geçiyor; API maliyetleri yoğun kullanımda ciddi rakamlara çıkıyor.
Yerel LLM çalıştırdığınızda:
- Verileriniz makinenizden çıkmıyor
- API limiti ve maliyeti yok
- İnternet kesilse bile model çalışıyor
- Modeli istediğiniz gibi fine-tune edebiliyorsunuz
Quantization teknolojilerinin olgunlaşmasıyla birlikte artık 8–16 GB VRAM’li orta segment ekran kartlarında 7B–14B parametreli modeller son derece kullanışlı hız ve kalitede çalışıyor.
Tüm bu araçları kısaca anlatmadan önce temel ayrımı netleştirelim:
| Kategori | Araçlar | Kimler için |
|---|---|---|
| CLI / sunucu | Ollama, vLLM, llama.cpp, LocalAI | Geliştiriciler, API entegrasyonu |
| Masaüstü GUI | LM Studio, GPT4All, Jan.ai | Teknik olmayan kullanıcılar |
| Web arayüzü | Open WebUI, Text Gen WebUI | Her profil, tarayıcı üzerinden |
1. Ollama — En Popüler, En Kolay CLI Aracı
Açık kaynak yerel LLM dünyasında tartışmasız en yaygın kullanılan araç. ollama run llama4 komutunun tek satırda modeli indirip başlatması, Ollama’yı 2024–2026 döneminin standartı haline getirdi.
Nasıl çalışır?
Ollama, llama.cpp üzerine inşa edilmiş bir wrapper’dır. GGUF formatındaki modelleri otomatik indirip yönetir, arka planda bir REST API sunucusu (port 11434) başlatır ve hem CLI hem de programatik erişim sunar.
# Kurulum (macOS)
brew install ollama
# Kurulum (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Model çalıştırma
ollama run llama3.2
ollama run qwen3:8b
ollama run mistral:7b
REST API ile kullanmak için:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Türkiye hakkında 3 madde yaz."
}'
Öne çıkan özellikler:
- 200+ model destekli resmi model kütüphanesi (Ollama Hub)
- Otomatik GPU algılama: CUDA, Metal (Apple Silicon), ROCm
- Çok satırlı model dosyası (Modelfile) ile özel model oluşturma
- OpenAI API uyumlu endpoint (
/v1/chat/completions)
Donanım gereksinimi: 7B model için minimum 8 GB RAM (GPU varsa 6 GB VRAM); 70B model için 48+ GB VRAM önerilir.
Zayıf yanları: Yüksek eşzamanlı istek trafiği için optimize edilmemiş. Birden fazla kullanıcı aynı anda istekte bulunacaksa vLLM daha iyi bir seçim.
Daha ayrıntılı kurulum için: İnternetsiz Yerel Yapay Zeka: Ollama Kurulum Rehberi
2. LM Studio — Teknik Olmayan Kullanıcılar İçin En İyi GUI
LM Studio, yerel LLM dünyasını Windows ve macOS kullanıcılarına ilk kez gerçekten erişilebilir kılan araç oldu. Kurulum yok, terminal yok; sadece indirip çalıştırıyorsunuz.
Nasıl çalışır?
Uygulama HuggingFace’i doğrudan içinden tarıyor, modeli indiriyor, yüklüyor ve tarayıcı tabanlı bir sohbet arayüzü açıyor. Arka planda yine llama.cpp var, ama tüm karmaşıklık arayüz tarafından gizleniyor.
Öne çıkan özellikler:
- Model keşfetme: GGUF formatındaki herhangi bir modeli HuggingFace’den tek tıkla indir
- Yerleşik sohbet arayüzü, sistem prompt, temperature ve context window ayarları
- Yerel sunucu modu: OpenAI uyumlu API endpoint başlatma (geliştiriciler de kullanabilir)
- Apple Silicon GPU (Metal) ve NVIDIA CUDA tam destek
Kim için uygun?
- Terminale hiç girmek istemeyenler
- Farklı modelleri hızlıca deneyip karşılaştırmak isteyenler
- Ortak çalıştığı araçlara (VS Code, Obsidian eklentisi vb.) OpenAI uyumlu endpoint gerektirenler
Zayıf yanları: Ücretsiz ve açık kaynak değil (kaynak kod kapalı, ama kullanımı ücretsiz). Sunucu üzerinde çalıştırmak için uygun değil; masaüstü uygulaması olarak tasarlanmış.
3. vLLM — Yüksek Verimli Üretim Sunucusu
vLLM, UC Berkeley’de geliştirilen ve PagedAttention algoritmasıyla GPU belleğini son derece verimli kullanan bir çıkarım motorudur. Bireysel kullanım için değil; API sunucusu olarak yüksek trafikli ortamlar için tasarlanmış.
Nasıl çalışır?
pip install vllm
# Sunucuyu başlat
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-8B-Instruct \
--port 8000
Başladıktan sonra standart OpenAI Python kütüphanesiyle doğrudan kullanabilirsiniz:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
response = client.chat.completions.create(
model="meta-llama/Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "Merhaba!"}]
)
print(response.choices[0].message.content)
Öne çıkan özellikler:
- PagedAttention ile geleneksel çıkarıma kıyasla 2–24× daha yüksek throughput
- Continuous batching: istekler kuyrukta beklemeden, boş olan slot dolduğunda işlenir
- LoRA adapter desteği, speculative decoding, tensor parallelism
- HuggingFace model hub ile doğrudan entegrasyon
Donanım gereksinimi: NVIDIA GPU zorunlu (CUDA). AMD ROCm desteği gelişiyor ama henüz kararlı değil. Apple Silicon desteklenmiyor.
Kim için uygun? Dahili API gateway, iç araç geliştirme veya birden fazla kullanıcıya hizmet verecek production ortamları.
4. llama.cpp — Her Şeyin Temeli
Bütün bu araçların büyük çoğunluğu, Georgi Gerganov’un yazdığı llama.cpp projesinin üzerine inşa edilmiş. Saf C/C++ ile yazılmış bu kütüphane, Meta’nın LLaMA modelini ilk kez tüketici donanımında çalıştıran projeydi.
Bugün llama.cpp tek başına da kullanılabiliyor:
# Derleme
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j
# Model çalıştırma
./build/bin/llama-cli \
-m ./models/llama-3.2-3b-q4_k_m.gguf \
-p "Yapay zeka nedir?" \
-n 256
Neden önemli?
- GGUF formatının standardını o belirledi
- CPU-only çalıştırma: GPU olmadan da makul hızda inference mümkün
- ARM, x86, Apple Silicon, WASM dahil neredeyse her platformda çalışır
- En düşük bağımlılık: sadece libcuda veya libmetal gerekiyor
Kim için uygun? Gömülü sistemler, Raspberry Pi, sunucuya erişim olmayan ortamlar veya maksimum kontrol isteyenler. Günlük kullanım için Ollama çok daha pratik, ama llama.cpp ne yaptığını anlamak isteyenler için temel başvuru noktası.
5. GPT4All — Offline Masaüstü Uygulaması
Nomic AI’nın geliştirdiği GPT4All, sıfır internet bağlantısı gerektiren offline bir masaüstü deneyimi sunuyor. LM Studio’ya benzer ama daha fazla gizlilik odaklı: kurulumdan sonra internet erişimi tamamen kesilse bile sorunsuz çalışıyor.
Öne çıkan özellikler:
- Windows, macOS, Linux için yerel yükleyici
- Yerel dosya sohbeti: PDF, TXT, Word belgelerini bağlam olarak yükleme
- LocalDocs özelliği ile kişisel bilgi tabanı oluşturma (basit RAG)
- 30+ modeli tek tıklamayla indirme
- CPU-only modda çalışabilme (GPU gerekmez)
Donanım gereksinimi: 7B model için 8 GB RAM yeterli (CPU modunda). GPU ile çok daha hızlı.
Zayıf yanları: Performans LM Studio ve Ollama kadar optimize değil. API endpoint özelliği mevcut ama sınırlı.
Kim için uygun? Tam offline çalışma gerektiren, gizliliği en üst düzeyde tutan ve kod yazmak istemeyen kullanıcılar. Kurumsal ortamlarda internet erişimi kısıtlı ekipler için iyi bir başlangıç noktası.
6. Open WebUI — Ollama için Tarayıcı Arayüzü
Ollama güçlü ama terminal arayüzü yeterince kullanıcı dostu değil. Open WebUI (önceki adıyla Ollama WebUI) bu boşluğu dolduruyor: tarayıcıdan ChatGPT benzeri bir arayüzle Ollama veya herhangi bir OpenAI uyumlu API’ya bağlanıyorsunuz.
Kurulum (Docker ile):
docker run -d \
-p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
Ardından http://localhost:3000 adresine gidin.
Öne çıkan özellikler:
- Çoklu model seçimi: aynı sohbette farklı modelleri deneme
- Görsel (multimodal) model desteği: llava gibi vision modellerini kullanma
- Belge yükleme ve RAG: PDF, URL veya dosyaları bağlam olarak ekleme
- Kullanıcı yönetimi: çok kullanıcılı ekip ortamı kurma
- Model parameter ayarları (temperature, top-p, context window) arayüzden
Kim için uygun? Ollama’yı Docker üzerinde çalıştıran ve ChatGPT benzeri bir deneyim isteyen geliştiriciler ve ekipler. Kendi şirket içi “ChatGPT alternatifini” kurmak isteyen küçük takımlar için ideal. RAG kurulumu için de sık tercih edilen arayüz.
7. Jan.ai — Açık Kaynak ChatGPT Masaüstü Alternatifi
Jan.ai, Electron tabanlı ve tamamen açık kaynak bir masaüstü uygulaması. LM Studio’nun ücretsiz ve açık kaynak alternatifi olarak konumlanıyor.
Öne çıkan özellikler:
- Windows, macOS, Linux için tek yükleyici
- Hem yerel modelleri hem de OpenAI, Anthropic, Groq gibi bulut API’larını aynı arayüzden yönetme
- Model Hub üzerinden GGUF modelleri doğrudan indirme
- Uzantı sistemi: ek özellikler plugin olarak eklenebiliyor
- Jan Server: arka planda çalışan, OpenAI uyumlu yerel API
Zayıf yanları: LM Studio kadar olgun değil. Bazı GGUF modellerinde yükleme sorunları yaşanabiliyor. Geliştirme hızlı ama kararlılık zaman zaman tutarsız.
Kim için uygun? Hem yerel modelleri hem de bulut API’larını tek arayüzden yönetmek ve gerçek anlamda açık kaynak bir çözüm kullanmak isteyenler.
Hangi Aracı Seçmeli? Karar Ağacı
| Senaryo | Önerilen Araç |
|---|---|
| Hızlı başlamak istiyorum, terminal bilgim var | Ollama |
| Terminale hiç girmek istemiyorum | LM Studio |
| Tam offline, gizlilik önceliğim | GPT4All |
| Ekibimle birlikte kullanacağım, web arayüzü istiyorum | Open WebUI + Ollama |
| Production API sunucusu kuracağım, NVIDIA GPU var | vLLM |
| Ne yaptığını anlamak, düşük seviye kontrol | llama.cpp |
| Hem yerel hem bulut API tek arayüzden | Jan.ai |
Donanım Gereksinimleri Özeti
Quantization sayesinde modern araçlar modeli daha küçük bit hassasiyetiyle depolayıp çalıştırıyor. Pratik rehber:
| Model Boyutu | Minimum VRAM (Q4) | Önerilen VRAM | Notlar |
|---|---|---|---|
| 3B (Llama 3.2, Phi 4 Mini) | 2–3 GB | 4 GB | Laptop GPU’larında bile çalışır |
| 7–8B (Mistral, Llama 3.1 8B) | 5–6 GB | 8 GB | En popüler aralık |
| 13–14B (Qwen 2.5 14B) | 9–10 GB | 12 GB | RTX 3080/4070 |
| 32B (Qwen 3 32B) | 20–22 GB | 24 GB | RTX 3090/4090 veya iki kart |
| 70B (Llama 3.3 70B) | 40–42 GB | 48 GB+ | Multi-GPU ya da CPU offload |
CPU-only çalıştırma mümkün mü? Evet; llama.cpp ve Ollama CPU modunu destekliyor. 7B model için modern bir CPU’da 2–5 token/saniye bekleyebilirsiniz — günlük sohbet için kullanılabilir ama production için yeterli değil.
Apple Silicon avantajı: M-serisi çipler birleşik bellek (unified memory) kullandığından RAM = VRAM gibi davranıyor. M3 Max (128 GB) ile 70B model sorunsuz çalışıyor.
Pratik Başlangıç: 5 Dakikada Yerel LLM
En hızlı yol Ollama + Open WebUI kombinasyonu:
# 1. Ollama kur ve modeli indir
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.2
# 2. Open WebUI'yi Docker ile başlat
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
# 3. Tarayıcıdan http://localhost:3000 adresine git
İki dakika sonra kendi makinenizde çalışan, tamamen gizli, sınırsız bir sohbet arayüzünüz hazır.
Sonuç
2026’da yerel LLM çalıştırmak artık gerçekten erişilebilir. Araç seçimi kullanım senaryonuza göre şekilleniyor:
- Günlük kullanım ve geliştirme: Ollama
- Ekip ortamı: Ollama + Open WebUI
- Terminal-free deneyim: LM Studio veya GPT4All
- Production yük testi: vLLM
Bu araçların her biri aktif geliştirilmeye devam ediyor. Belirli bir modeli daha verimli çalıştırmak istiyorsanız quantization formatlarını (GGUF, AWQ, GPTQ) ve donanım seçimini anlamak da aynı derecede önemli.



