Ollama (Yerel LLM Çalıştırıcı)

Llama, Mistral ve Phi gibi açık kaynaklı büyük dil modellerini yerel bilgisayarda tek komutla çalıştıran, OpenAI uyumlu API sunan hafif çalışma zamanı.

Ollama, büyük dil modellerini yerel bilgisayarda tek komutla indirip çalıştırmayı sağlayan açık kaynaklı bir araçtır. Docker'ın konteyner mantığını yapay zeka modellerine uyarlayan Ollama, karmaşık Python ortamı veya GPU sürücüsü kurulumu gerektirmeksizin `ollama run llama3` gibi sade bir komutla model çıkarımını başlatır. Ollama, GGUF formatını birincil model formatı olarak benimseyerek CPU ve Apple Silicon (Metal API) üzerinde optimize çalışma sağlar. Llama 3, Mistral, Phi-3, Qwen 2.5, Gemma 2 ve DeepSeek-R1 dahil onlarca modelin resmi ve topluluk sürümleri Ollama model kütüphanesinde mevcuttur. `ollama pull` komutuyla istenen model otomatik olarak indirilir ve çalışmaya hazır hale gelir. Ollama'nın önemli özelliklerinden biri yerel OpenAI uyumlu REST API sunmasıdır. `http://localhost:11434/v1/chat/completions` adresi üzerinden OpenAI istemci kütüphaneleri, LangChain ve Open WebUI gibi araçlar doğrudan yerel modele yönlendirilebilir; bu da mevcut uygulamaların bulut AI'dan yerel AI'ya minimum kod değişikliğiyle geçişini mümkün kılar. Gizlilik açısından Ollama, verilerin hiçbir zaman dış sunuculara gönderilmediği garantisini sağlar. Tıbbi kayıtlar, hukuki belgeler veya şirket içi hassas verilerle çalışan kullanıcılar için bu özellik kritik bir avantajdır. Ayrıca internet bağlantısı kesildiğinde bile model çalışmaya devam eder. Modelfile sistemi ile modeller özelleştirilebilir: sistem promptu, sıcaklık ve bağlam penceresi gibi parametreler Dockerfile benzeri bir sözdizimle tanımlanır ve özel ağırlık setleriyle birleştirilerek paylaşılabilir özel modeller oluşturulur.