tag GGUF

Bu sayfada GGUF etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.

GGUF (GPT-Generated Unified Format), büyük dil modellerini tek bir dosyada verimli biçimde depolayan ve CPU üzerinde çalıştırmaya optimize edilmiş bir model formatıdır. llama.cpp kütüphanesi tarafından 2023 yılında GGML formatının yerini almak üzere geliştirilmiştir. GGUF'un temel özelliği, model ağırlıklarını, tokenizer bilgisini, hiperparametreleri ve meta verileri tek bir dosyada birleştirmesidir. Bu tasarım, kullanıcıların ek yapılandırma dosyaları veya bağımlılıklar olmadan modeli tek adımda yüklemesine olanak tanır. Önceki GGML formatında bu bilgiler dağınık biçimde saklanıyordu ve uyumsuzluk sorunları sıkça yaşanıyordu. Kantizasyon (quantization), GGUF'un belleği küçültme ve CPU hızını artırma yöntemidir. 32-bit kayan noktalı ağırlıkları 4-bit veya 8-bit tamsayıya dönüştürerek model boyutunu üçte birine kadar küçültür. Q4_K_M, Q5_K_M ve Q8_0 gibi farklı kantizasyon seviyeleri, model kalitesi ile bellek kullanımı arasındaki dengeyi ayarlar. Llama 3, Mistral, Phi ve Qwen gibi popüler açık kaynaklı modellerin GGUF sürümleri Hugging Face üzerinde yaygın olarak paylaşılmaktadır. Ollama ve LM Studio gibi yerel çalıştırma araçları da GGUF'u birincil format olarak benimsemiştir. GGUF, GPU olmayan tüketici donanımında yerel yapay zeka kullanımını demokratize etmiş ve bulut bağımlılığını azaltma yolunda önemli bir araç haline gelmiştir. 7 milyar parametreli modeller, 8GB RAM ile sorunsuz çalışabilmekte ve giderek daha geniş bir kullanıcı kitlesine ulaşmaktadır.

storage

GGUF (Model Formatı)

GGUF (GPT-Generated Unified Format), büyük dil modellerini tek bir dosyada verimli biçimde depolayan ve CPU üzerinde çalıştırmaya optimize edilmiş bir model formatıdır. llama.cpp kütüphanesi tarafından 2023 yılında GGML formatının yerini almak üzere geliştirilmiştir. GGUF'un temel özelliği, model ağırlıklarını, tokenizer bilgisini, hiperparametreleri ve meta verileri tek bir dosyada birleştirmesidir. Bu tasarım, kullanıcıların ek yapılandırma dosyaları veya bağımlılıklar olmadan modeli tek adımda yüklemesine olanak tanır. Önceki GGML formatında bu bilgiler dağınık biçimde saklanıyordu ve uyumsuzluk sorunları sıkça yaşanıyordu. Kantizasyon (quantization), GGUF'un belleği küçültme ve CPU hızını artırma yöntemidir. 32-bit kayan noktalı ağırlıkları 4-bit veya 8-bit tamsayıya dönüştürerek model boyutunu üçte birine kadar küçültür. Q4_K_M, Q5_K_M ve Q8_0 gibi farklı kantizasyon seviyeleri, model kalitesi ile bellek kullanımı arasındaki dengeyi ayarlar. Llama 3, Mistral, Phi ve Qwen gibi popüler açık kaynaklı modellerin GGUF sürümleri Hugging Face üzerinde yaygın olarak paylaşılmaktadır. Ollama ve LM Studio gibi yerel çalıştırma araçları da GGUF'u birincil format olarak benimsemiştir. GGUF, GPU olmayan tüketici donanımında yerel yapay zeka kullanımını demokratize etmiş ve bulut bağımlılığını azaltma yolunda önemli bir araç haline gelmiştir. 7 milyar parametreli modeller, 8GB RAM ile sorunsuz çalışabilmekte ve giderek daha geniş bir kullanıcı kitlesine ulaşmaktadır.

arrow_forward
computer

Ollama (Yerel LLM Çalıştırıcı)

Ollama, büyük dil modellerini yerel bilgisayarda tek komutla indirip çalıştırmayı sağlayan açık kaynaklı bir araçtır. Docker'ın konteyner mantığını yapay zeka modellerine uyarlayan Ollama, karmaşık Python ortamı veya GPU sürücüsü kurulumu gerektirmeksizin `ollama run llama3` gibi sade bir komutla model çıkarımını başlatır. Ollama, GGUF formatını birincil model formatı olarak benimseyerek CPU ve Apple Silicon (Metal API) üzerinde optimize çalışma sağlar. Llama 3, Mistral, Phi-3, Qwen 2.5, Gemma 2 ve DeepSeek-R1 dahil onlarca modelin resmi ve topluluk sürümleri Ollama model kütüphanesinde mevcuttur. `ollama pull` komutuyla istenen model otomatik olarak indirilir ve çalışmaya hazır hale gelir. Ollama'nın önemli özelliklerinden biri yerel OpenAI uyumlu REST API sunmasıdır. `http://localhost:11434/v1/chat/completions` adresi üzerinden OpenAI istemci kütüphaneleri, LangChain ve Open WebUI gibi araçlar doğrudan yerel modele yönlendirilebilir; bu da mevcut uygulamaların bulut AI'dan yerel AI'ya minimum kod değişikliğiyle geçişini mümkün kılar. Gizlilik açısından Ollama, verilerin hiçbir zaman dış sunuculara gönderilmediği garantisini sağlar. Tıbbi kayıtlar, hukuki belgeler veya şirket içi hassas verilerle çalışan kullanıcılar için bu özellik kritik bir avantajdır. Ayrıca internet bağlantısı kesildiğinde bile model çalışmaya devam eder. Modelfile sistemi ile modeller özelleştirilebilir: sistem promptu, sıcaklık ve bağlam penceresi gibi parametreler Dockerfile benzeri bir sözdizimle tanımlanır ve özel ağırlık setleriyle birleştirilerek paylaşılabilir özel modeller oluşturulur.

arrow_forward
code_blocks

LM Studio (LM Studio)

LM Studio, açık kaynaklı büyük dil modellerini (LLM) kişisel bilgisayarda internet bağlantısı olmadan çalıştırmak için tasarlanmış ücretsiz bir masaüstü uygulamasıdır. Windows, macOS ve Linux platformlarını destekleyen uygulama, terminal bilgisi gerektirmeden grafiksel arayüz üzerinden model indirme, yükleme ve sohbet imkânı sunar. LM Studio'nun temel bileşeni model hub'ıdır: Hugging Face'teki GGUF formatındaki modeller uygulama içinden aranabilir, donanım uyumluluğuna ve parametre boyutuna göre filtrelenebilir ve tek tıkla indirilebilir. 2026 itibarıyla katalogda Llama 3, Qwen3, Gemma 3, Mistral, DeepSeek ve Phi serileri başlıca yer almaktadır. Çıkarım motoru olarak LM Studio iki seçenek sunar: NVIDIA, AMD ve Intel GPU'ları ile CPU'yu destekleyen llama.cpp motoru ve Apple Silicon (M1/M2/M3/M4) için optimize edilmiş MLX motoru. Bu sayede Apple Silicon cihazlarda birleşik bellek mimarisinin tüm avantajından yararlanılır; örneğin 32 GB RAM'li bir M2 MacBook Pro üzerinde 34B parametreli model rahatça çalışabilir. LM Studio aynı zamanda yerel bir API sunucusu (local server) barındırır. Bu sunucu OpenAI API biçiminde uç nokta sağladığından Continue.dev, Open WebUI veya özel Python uygulamaları gibi herhangi bir OpenAI uyumlu araç, LM Studio'yu arka uç (backend) olarak kullanabilir. Bu özellik özellikle gizlilik gerektiren kurumsal geliştirme senaryolarında değer taşır. 0.4.x sürümüyle birlikte çok GPU'lu tensor-paralel çıkarım (tensor-parallel multi-GPU), spekülatif kod çözme (speculative decoding) ve Llama 3.2 Vision gibi multimodal modeller desteği geldi. Ayrıca llmster adlı komut satırı aracı, GUI olmaksızın Linux sunucularda veya CI/CD boru hatlarında modelleri headless biçimde çalıştırmayı mümkün kılar. Gizlilik, düşük maliyet ve veri egemenliği açısından LM Studio; Ollama, Jan ve OpenWebUI gibi araçlarla birlikte yerel yapay zeka ekosisteminin en popüler bileşenlerinden biri hâline gelmiştir.

arrow_forward