tag GGUF
Bu sayfada GGUF etiketi ile işaretlenmiş 3 yapay zeka kavramını bulabilirsiniz.
GGUF (GPT-Generated Unified Format), büyük dil modellerini (LLM) tek bir dosyada saklamak ve dağıtmak için tasarlanmış ikili bir dosya biçimidir. Ağırlıklar, tokenizer yapılandırması, model mimarisi ve hiperparametreler gibi tüm bileşenler bu tek dosyada bir araya getirilir; bu sayede modeli farklı sistemlerde çalıştırmak için ek yapılandırma dosyasına gerek kalmaz. GGUF, Ağustos 2023'te llama.cpp projesi tarafından eski GGML formatının yerini almak üzere geliştirildi. GGML'in önemli bir dezavantajı vardı: model yapısı değiştiğinde önceki sürümlerle uyumsuzluk oluşuyor ve kullanıcılar dosyalarını yeniden indirmek zorunda kalıyordu. GGUF ise genişletilebilir meta veri yapısıyla geriye dönük uyumluluğu korur. Formatın en önemli özelliği niceleme (quantization) desteğidir. Niceleme, model ağırlıklarını 32 bitlik kayan nokta yerine daha az bit kullanan tam sayılarla temsil ederek dosya boyutunu ve bellek gereksinimini büyük ölçüde azaltır. Başlıca niceleme düzeyleri şunlardır: - **Q4_K_M**: 4 bit, orta ölçekli k-niceleme; kalite ile hız arasında iyi denge sağlar ve 7B modelleri için önerilen standarttır. - **Q5_K_M**: 5 bit, biraz daha yüksek doğruluk; disk alanı pahasına daha iyi çıktı üretir. - **Q8_0**: 8 bit; orijinal modele en yakın kaliteyi sunar, ancak dosya boyutu oldukça büyüktür. - **Q2_K**: 2 bit; bellek kısıtlı cihazlar için minimize edilmiş seçenek, ancak çıktı kalitesi belirgin düşer. GGUF dosyaları; llama.cpp, Ollama, LM Studio ve GPT4All gibi araçlarla sorunsuz çalışır. Bu araçlar, GGUF modellerini CPU ile çalıştırabilir, GPU katmanlarına kısmi yükleyebilir (GPU offloading) ya da Apple Silicon'ın Metal API'si aracılığıyla hızlandırabilir. Hugging Face Model Hub'da binlerce hazır GGUF dosyası barındırılmakta; topluluk tarafından dönüştürülmüş ve nicelenmiş modeller kolayca indirilebilmektedir. Alternatif formatlarla karşılaştırıldığında GGUF, taşınabilirlik açısından öne çıkar. GPTQ ve AWQ GPU odaklı niceleme formatları olduğundan CPU desteği sınırlıdır. Safetensors ise güvenli ve hızlı yükleme sunar ancak ayrı tokenizer dosyası gerektirir. GGUF'un tek dosya + CPU uyumluluğu yaklaşımı, lokal ve edge dağıtım senaryolarında onu özellikle avantajlı kılar.
GGUF (Model Formatı)
GGUF (GPT-Generated Unified Format), büyük dil modellerini (LLM) tek bir dosyada saklamak ve dağıtmak için tasarlanmış ikili bir dosya biçimidir. Ağırlıklar, tokenizer yapılandırması, model mimarisi ve hiperparametreler gibi tüm bileşenler bu tek dosyada bir araya getirilir; bu sayede modeli farklı sistemlerde çalıştırmak için ek yapılandırma dosyasına gerek kalmaz. GGUF, Ağustos 2023'te llama.cpp projesi tarafından eski GGML formatının yerini almak üzere geliştirildi. GGML'in önemli bir dezavantajı vardı: model yapısı değiştiğinde önceki sürümlerle uyumsuzluk oluşuyor ve kullanıcılar dosyalarını yeniden indirmek zorunda kalıyordu. GGUF ise genişletilebilir meta veri yapısıyla geriye dönük uyumluluğu korur. Formatın en önemli özelliği niceleme (quantization) desteğidir. Niceleme, model ağırlıklarını 32 bitlik kayan nokta yerine daha az bit kullanan tam sayılarla temsil ederek dosya boyutunu ve bellek gereksinimini büyük ölçüde azaltır. Başlıca niceleme düzeyleri şunlardır: - **Q4_K_M**: 4 bit, orta ölçekli k-niceleme; kalite ile hız arasında iyi denge sağlar ve 7B modelleri için önerilen standarttır. - **Q5_K_M**: 5 bit, biraz daha yüksek doğruluk; disk alanı pahasına daha iyi çıktı üretir. - **Q8_0**: 8 bit; orijinal modele en yakın kaliteyi sunar, ancak dosya boyutu oldukça büyüktür. - **Q2_K**: 2 bit; bellek kısıtlı cihazlar için minimize edilmiş seçenek, ancak çıktı kalitesi belirgin düşer. GGUF dosyaları; llama.cpp, Ollama, LM Studio ve GPT4All gibi araçlarla sorunsuz çalışır. Bu araçlar, GGUF modellerini CPU ile çalıştırabilir, GPU katmanlarına kısmi yükleyebilir (GPU offloading) ya da Apple Silicon'ın Metal API'si aracılığıyla hızlandırabilir. Hugging Face Model Hub'da binlerce hazır GGUF dosyası barındırılmakta; topluluk tarafından dönüştürülmüş ve nicelenmiş modeller kolayca indirilebilmektedir. Alternatif formatlarla karşılaştırıldığında GGUF, taşınabilirlik açısından öne çıkar. GPTQ ve AWQ GPU odaklı niceleme formatları olduğundan CPU desteği sınırlıdır. Safetensors ise güvenli ve hızlı yükleme sunar ancak ayrı tokenizer dosyası gerektirir. GGUF'un tek dosya + CPU uyumluluğu yaklaşımı, lokal ve edge dağıtım senaryolarında onu özellikle avantajlı kılar.
Ollama (Yerel LLM Çalıştırıcı)
Ollama, büyük dil modellerini yerel bilgisayarda tek komutla indirip çalıştırmayı sağlayan açık kaynaklı bir araçtır. Docker'ın konteyner mantığını yapay zeka modellerine uyarlayan Ollama, karmaşık Python ortamı veya GPU sürücüsü kurulumu gerektirmeksizin `ollama run llama3` gibi sade bir komutla model çıkarımını başlatır. Ollama, GGUF formatını birincil model formatı olarak benimseyerek CPU ve Apple Silicon (Metal API) üzerinde optimize çalışma sağlar. Llama 3, Mistral, Phi-3, Qwen 2.5, Gemma 2 ve DeepSeek-R1 dahil onlarca modelin resmi ve topluluk sürümleri Ollama model kütüphanesinde mevcuttur. `ollama pull` komutuyla istenen model otomatik olarak indirilir ve çalışmaya hazır hale gelir. Ollama'nın önemli özelliklerinden biri yerel OpenAI uyumlu REST API sunmasıdır. `http://localhost:11434/v1/chat/completions` adresi üzerinden OpenAI istemci kütüphaneleri, LangChain ve Open WebUI gibi araçlar doğrudan yerel modele yönlendirilebilir; bu da mevcut uygulamaların bulut AI'dan yerel AI'ya minimum kod değişikliğiyle geçişini mümkün kılar. Gizlilik açısından Ollama, verilerin hiçbir zaman dış sunuculara gönderilmediği garantisini verir. Tıbbi kayıtlar, hukuki belgeler veya şirket içi hassas verilerle çalışan kullanıcılar için bu özellik kritik bir avantajdır. Ayrıca internet bağlantısı kesildiğinde bile model çalışmaya devam eder. Modelfile sistemi ile modeller özelleştirilebilir: sistem promptu, sıcaklık ve bağlam penceresi gibi parametreler Dockerfile benzeri bir sözdizimle tanımlanır ve özel ağırlık setleriyle birleştirilerek paylaşılabilir özel modeller oluşturulur. Ollama ayrıca çok modelli çalışmayı destekler; aynı anda birden fazla model bellekte tutularak farklı görevlere yönlendirilebilir. Araç, macOS, Linux ve Windows üzerinde yerel çalışarak geniş bir kullanıcı kitlesine hitap etmektedir. MIT lisansı kapsamında geliştirilen bu proje, yerel yapay zeka çalıştırmanın demokratikleşmesinde önemli bir rol üstlenmekte; hem bireysel geliştiriciler hem de kurumsal veri gizliliği gereksinimleri olan kuruluşlar için güçlü bir tercih haline gelmektedir. Quantizasyon teknikleri (Q4, Q5, Q8) model boyutunu ve RAM gereksinimini düşürerek sınırlı donanımda bile kullanışlı sonuçlar elde edilmesini mümkün kılar.
LM Studio (LM Studio)
LM Studio, açık kaynaklı büyük dil modellerini (LLM) kişisel bilgisayarda internet bağlantısı olmadan çalıştırmak için tasarlanmış ücretsiz bir masaüstü uygulamasıdır. Windows, macOS ve Linux platformlarını destekleyen uygulama, terminal bilgisi gerektirmeden grafiksel arayüz üzerinden model indirme, yükleme ve sohbet imkânı sunar. LM Studio'nun temel bileşeni model hub'ıdır: Hugging Face'teki GGUF formatındaki modeller uygulama içinden aranabilir, donanım uyumluluğuna ve parametre boyutuna göre filtrelenebilir ve tek tıkla indirilebilir. 2026 itibarıyla katalogda Llama 3, Qwen3, Gemma 3, Mistral, DeepSeek ve Phi serileri başlıca yer almaktadır. Çıkarım motoru olarak LM Studio iki seçenek sunar: NVIDIA, AMD ve Intel GPU'ları ile CPU'yu destekleyen llama.cpp motoru ve Apple Silicon (M1/M2/M3/M4) için optimize edilmiş MLX motoru. Bu sayede Apple Silicon cihazlarda birleşik bellek mimarisinin tüm avantajından yararlanılır; örneğin 32 GB RAM'li bir M2 MacBook Pro üzerinde 34B parametreli model rahatça çalışabilir. LM Studio aynı zamanda yerel bir API sunucusu (local server) barındırır. Bu sunucu OpenAI API biçiminde uç nokta sağladığından Continue.dev, Open WebUI veya özel Python uygulamaları gibi herhangi bir OpenAI uyumlu araç, LM Studio'yu arka uç (backend) olarak kullanabilir. Bu özellik özellikle gizlilik gerektiren kurumsal geliştirme senaryolarında değer taşır. 0.4.x sürümüyle birlikte çok GPU'lu tensor-paralel çıkarım (tensor-parallel multi-GPU), spekülatif kod çözme (speculative decoding) ve Llama 3.2 Vision gibi multimodal modeller desteği geldi. Ayrıca llmster adlı komut satırı aracı, GUI olmaksızın Linux sunucularda veya CI/CD boru hatlarında modelleri headless biçimde çalıştırmayı mümkün kılar. Gizlilik, düşük maliyet ve veri egemenliği açısından LM Studio; Ollama, Jan ve OpenWebUI gibi araçlarla birlikte yerel yapay zeka ekosisteminin en popüler bileşenlerinden biri hâline gelmiştir.