tag Ollama

Bu sayfada Ollama etiketi ile işaretlenmiş 4 yapay zeka kavramını bulabilirsiniz.

Ollama, büyük dil modellerini yerel bilgisayarda tek komutla indirip çalıştırmayı sağlayan açık kaynaklı bir araçtır. Docker'ın konteyner mantığını yapay zeka modellerine uyarlayan Ollama, karmaşık Python ortamı veya GPU sürücüsü kurulumu gerektirmeksizin `ollama run llama3` gibi sade bir komutla model çıkarımını başlatır. Ollama, GGUF formatını birincil model formatı olarak benimseyerek CPU ve Apple Silicon (Metal API) üzerinde optimize çalışma sağlar. Llama 3, Mistral, Phi-3, Qwen 2.5, Gemma 2 ve DeepSeek-R1 dahil onlarca modelin resmi ve topluluk sürümleri Ollama model kütüphanesinde mevcuttur. `ollama pull` komutuyla istenen model otomatik olarak indirilir ve çalışmaya hazır hale gelir. Ollama'nın önemli özelliklerinden biri yerel OpenAI uyumlu REST API sunmasıdır. `http://localhost:11434/v1/chat/completions` adresi üzerinden OpenAI istemci kütüphaneleri, LangChain ve Open WebUI gibi araçlar doğrudan yerel modele yönlendirilebilir; bu da mevcut uygulamaların bulut AI'dan yerel AI'ya minimum kod değişikliğiyle geçişini mümkün kılar. Gizlilik açısından Ollama, verilerin hiçbir zaman dış sunuculara gönderilmediği garantisini verir. Tıbbi kayıtlar, hukuki belgeler veya şirket içi hassas verilerle çalışan kullanıcılar için bu özellik kritik bir avantajdır. Ayrıca internet bağlantısı kesildiğinde bile model çalışmaya devam eder. Modelfile sistemi ile modeller özelleştirilebilir: sistem promptu, sıcaklık ve bağlam penceresi gibi parametreler Dockerfile benzeri bir sözdizimle tanımlanır ve özel ağırlık setleriyle birleştirilerek paylaşılabilir özel modeller oluşturulur. Ollama ayrıca çok modelli çalışmayı destekler; aynı anda birden fazla model bellekte tutularak farklı görevlere yönlendirilebilir. Araç, macOS, Linux ve Windows üzerinde yerel çalışarak geniş bir kullanıcı kitlesine hitap etmektedir. MIT lisansı kapsamında geliştirilen bu proje, yerel yapay zeka çalıştırmanın demokratikleşmesinde önemli bir rol üstlenmekte; hem bireysel geliştiriciler hem de kurumsal veri gizliliği gereksinimleri olan kuruluşlar için güçlü bir tercih haline gelmektedir. Quantizasyon teknikleri (Q4, Q5, Q8) model boyutunu ve RAM gereksinimini düşürerek sınırlı donanımda bile kullanışlı sonuçlar elde edilmesini mümkün kılar.

storage

GGUF (Model Formatı)

GGUF (GPT-Generated Unified Format), büyük dil modellerini (LLM) tek bir dosyada saklamak ve dağıtmak için tasarlanmış ikili bir dosya biçimidir. Ağırlıklar, tokenizer yapılandırması, model mimarisi ve hiperparametreler gibi tüm bileşenler bu tek dosyada bir araya getirilir; bu sayede modeli farklı sistemlerde çalıştırmak için ek yapılandırma dosyasına gerek kalmaz. GGUF, Ağustos 2023'te llama.cpp projesi tarafından eski GGML formatının yerini almak üzere geliştirildi. GGML'in önemli bir dezavantajı vardı: model yapısı değiştiğinde önceki sürümlerle uyumsuzluk oluşuyor ve kullanıcılar dosyalarını yeniden indirmek zorunda kalıyordu. GGUF ise genişletilebilir meta veri yapısıyla geriye dönük uyumluluğu korur. Formatın en önemli özelliği niceleme (quantization) desteğidir. Niceleme, model ağırlıklarını 32 bitlik kayan nokta yerine daha az bit kullanan tam sayılarla temsil ederek dosya boyutunu ve bellek gereksinimini büyük ölçüde azaltır. Başlıca niceleme düzeyleri şunlardır: - **Q4_K_M**: 4 bit, orta ölçekli k-niceleme; kalite ile hız arasında iyi denge sağlar ve 7B modelleri için önerilen standarttır. - **Q5_K_M**: 5 bit, biraz daha yüksek doğruluk; disk alanı pahasına daha iyi çıktı üretir. - **Q8_0**: 8 bit; orijinal modele en yakın kaliteyi sunar, ancak dosya boyutu oldukça büyüktür. - **Q2_K**: 2 bit; bellek kısıtlı cihazlar için minimize edilmiş seçenek, ancak çıktı kalitesi belirgin düşer. GGUF dosyaları; llama.cpp, Ollama, LM Studio ve GPT4All gibi araçlarla sorunsuz çalışır. Bu araçlar, GGUF modellerini CPU ile çalıştırabilir, GPU katmanlarına kısmi yükleyebilir (GPU offloading) ya da Apple Silicon'ın Metal API'si aracılığıyla hızlandırabilir. Hugging Face Model Hub'da binlerce hazır GGUF dosyası barındırılmakta; topluluk tarafından dönüştürülmüş ve nicelenmiş modeller kolayca indirilebilmektedir. Alternatif formatlarla karşılaştırıldığında GGUF, taşınabilirlik açısından öne çıkar. GPTQ ve AWQ GPU odaklı niceleme formatları olduğundan CPU desteği sınırlıdır. Safetensors ise güvenli ve hızlı yükleme sunar ancak ayrı tokenizer dosyası gerektirir. GGUF'un tek dosya + CPU uyumluluğu yaklaşımı, lokal ve edge dağıtım senaryolarında onu özellikle avantajlı kılar.

arrow_forward
devices

Local AI (Yerel Yapay Zeka)

Yerel Yapay Zeka (Local AI), bir yapay zeka modelinin uzak bir veri merkezi yerine kullanıcının kendi cihazında — dizüstü bilgisayar, masaüstü, telefon, gömülü sistem veya kurum içi sunucu — çalıştırılması yaklaşımını tanımlar. Bu yaklaşım; veri gizliliği, çevrimdışı çalışma, düşük gecikme ve maliyet kontrolü gibi gereksinimlerin öne çıktığı senaryolarda tercih edilir. Yerel AI'nin günümüzdeki yaygınlaşmasını mümkün kılan üç temel gelişme vardır. Birincisi, Llama, Mistral, Gemma ve Phi gibi açık ağırlıklı modellerin yayımlanmasıdır; ikincisi, GGUF gibi quantization formatları ile 7B–70B parametreli modellerin tüketici donanımında verimli çalışabilmesidir; üçüncüsü ise Ollama, LM Studio, llama.cpp ve Open WebUI gibi kullanım kolaylığı yüksek araçların gelmesidir. Apple Silicon'ın birleşik bellek mimarisi ve NVIDIA'nın tüketici GPU'ları, yerel çıkarımı daha da pratik hâle getirmiştir. Yerel AI'nin tipik kullanım alanları arasında kurum içi kod asistanları, hassas sağlık ve hukuk metinlerinin işlenmesi, kişisel notlar üzerinde RAG, çevrimdışı görüntü tanıma ve gömülü ses asistanları yer alır. Verinin cihazdan ayrılmaması, KVKK ve GDPR gibi düzenlemelere uyum için belirgin bir avantaj sunar. Bununla birlikte yerel AI'nin sınırları vardır: en büyük amiral modeller bugün hâlâ bulut tarafında çalışır ve tüketici donanımına sığmaz. Donanım yatırımı, model güncellemesi, performans ayarı ve güvenlik yamaları kullanıcının kendi sorumluluğundadır. Pratikte birçok ekip; hassas görevleri yerelde, ağır akıl yürütmeyi ise bulut LLM servislerinde çalıştıran hibrit mimariler tercih eder. 7B model için minimum 8 GB VRAM, 13B için 16 GB, 70B için 48 GB ve üzeri GPU belleği ya da birleşik bellek gerekir; quantization (GGUF Q4/Q5/Q8) bu gereksinimleri iki ila dört kat azaltabilir. On-device AI çipleri (Apple Neural Engine, Qualcomm AI 100) ise yerel yapay zekayı mobil cihazlara taşıma yolunda hız kazanmaktadır.

arrow_forward
computer

Ollama (Yerel LLM Çalıştırıcı)

Ollama, büyük dil modellerini yerel bilgisayarda tek komutla indirip çalıştırmayı sağlayan açık kaynaklı bir araçtır. Docker'ın konteyner mantığını yapay zeka modellerine uyarlayan Ollama, karmaşık Python ortamı veya GPU sürücüsü kurulumu gerektirmeksizin `ollama run llama3` gibi sade bir komutla model çıkarımını başlatır. Ollama, GGUF formatını birincil model formatı olarak benimseyerek CPU ve Apple Silicon (Metal API) üzerinde optimize çalışma sağlar. Llama 3, Mistral, Phi-3, Qwen 2.5, Gemma 2 ve DeepSeek-R1 dahil onlarca modelin resmi ve topluluk sürümleri Ollama model kütüphanesinde mevcuttur. `ollama pull` komutuyla istenen model otomatik olarak indirilir ve çalışmaya hazır hale gelir. Ollama'nın önemli özelliklerinden biri yerel OpenAI uyumlu REST API sunmasıdır. `http://localhost:11434/v1/chat/completions` adresi üzerinden OpenAI istemci kütüphaneleri, LangChain ve Open WebUI gibi araçlar doğrudan yerel modele yönlendirilebilir; bu da mevcut uygulamaların bulut AI'dan yerel AI'ya minimum kod değişikliğiyle geçişini mümkün kılar. Gizlilik açısından Ollama, verilerin hiçbir zaman dış sunuculara gönderilmediği garantisini verir. Tıbbi kayıtlar, hukuki belgeler veya şirket içi hassas verilerle çalışan kullanıcılar için bu özellik kritik bir avantajdır. Ayrıca internet bağlantısı kesildiğinde bile model çalışmaya devam eder. Modelfile sistemi ile modeller özelleştirilebilir: sistem promptu, sıcaklık ve bağlam penceresi gibi parametreler Dockerfile benzeri bir sözdizimle tanımlanır ve özel ağırlık setleriyle birleştirilerek paylaşılabilir özel modeller oluşturulur. Ollama ayrıca çok modelli çalışmayı destekler; aynı anda birden fazla model bellekte tutularak farklı görevlere yönlendirilebilir. Araç, macOS, Linux ve Windows üzerinde yerel çalışarak geniş bir kullanıcı kitlesine hitap etmektedir. MIT lisansı kapsamında geliştirilen bu proje, yerel yapay zeka çalıştırmanın demokratikleşmesinde önemli bir rol üstlenmekte; hem bireysel geliştiriciler hem de kurumsal veri gizliliği gereksinimleri olan kuruluşlar için güçlü bir tercih haline gelmektedir. Quantizasyon teknikleri (Q4, Q5, Q8) model boyutunu ve RAM gereksinimini düşürerek sınırlı donanımda bile kullanışlı sonuçlar elde edilmesini mümkün kılar.

arrow_forward
web

Open WebUI (Open WebUI)

Open WebUI, Ollama ve OpenAI uyumlu API'ler aracılığıyla yerel büyük dil modellerine erişmek için kendi sunucunuzda barındırabileceğiniz açık kaynaklı bir web arayüzüdür. ChatGPT benzeri bir deneyimi tamamen özel ortamda sunan Open WebUI; konuşma geçmişi, model yönetimi, RAG pipeline desteği ve çoklu kullanıcı özellikleriyle öne çıkar. Açık kaynak yapay zeka araçlarının popülerleşmesiyle birlikte kullanıcılar, verilerini üçüncü taraf bulut servislerine göndermeden güçlü dil modellerinden yararlanmak istemeye başladı. Open WebUI bu ihtiyaca yanıt veren en kapsamlı self-hosted çözümlerden biridir. Proje, 2023 yılında başlayarak kısa sürede GitHub'da on binlerce yıldız topladı ve aktif bir topluluk desteğiyle gelişmeye devam etmektedir. Teknik açıdan Open WebUI; Docker konteyneri olarak çalışır ve Ollama aracılığıyla Llama, Mistral, Gemma gibi yerel modellere; OpenAI API anahtarıyla da GPT serilerine bağlanabilir. Arayüz; sohbet geçmişini yerel veritabanında saklar, farklı modeller arasında anlık geçiş yapılmasına izin verir ve kullanıcı başına ayrı profil yönetimi sunar. Bunlara ek olarak, PDF ve web sayfalarını bilgi tabanına ekleyerek model yanıtlarını zenginleştiren bir RAG (Retrieval-Augmented Generation) motoru da yerleşik olarak gelir. Veri gizliliği açısından Open WebUI kritik bir avantaj taşır: tüm sohbet içerikleri ve belgeler kullanıcının kendi altyapısında kalır. Türkiye'deki şirketler, KVKK kapsamında kişisel veri içeren sorguları bulut tabanlı yapay zeka servislerine göndermekten kaçınmak için Open WebUI gibi yerel çözümlere yönelmektedir. Özellikle hukuk, sağlık ve finans sektöründe bu tür gizlilik gereksinimleri belirleyici olmaktadır. Kurulum açısından bakıldığında, Docker yüklü herhangi bir Linux sunucusu veya macOS makinesi üzerinde tek bir komutla çalıştırılabilmesi Open WebUI'yi erişilebilir kılar. GPU desteği isteğe bağlıdır; CPU üzerinde çalışan küçük modeller düşük donanımlı ortamlarda da kullanılabilir. Bu esneklik, bireylerin kişisel bilgisayarlarından kurumsal veri merkezlerine kadar geniş bir dağıtım yelpazesini kapsar.

arrow_forward