GGUF (Model Formatı)
Büyük dil modellerini tokenizer ve meta veriyle birlikte tek dosyada depolayan, CPU üzerinde kantizasyonlu çalıştırmaya optimize edilmiş model formatı.
GGUF (GPT-Generated Unified Format), büyük dil modellerini (LLM) tek bir dosyada saklamak ve dağıtmak için tasarlanmış ikili bir dosya biçimidir. Ağırlıklar, tokenizer yapılandırması, model mimarisi ve hiperparametreler gibi tüm bileşenler bu tek dosyada bir araya getirilir; bu sayede modeli farklı sistemlerde çalıştırmak için ek yapılandırma dosyasına gerek kalmaz. GGUF, Ağustos 2023'te llama.cpp projesi tarafından eski GGML formatının yerini almak üzere geliştirildi. GGML'in önemli bir dezavantajı vardı: model yapısı değiştiğinde önceki sürümlerle uyumsuzluk oluşuyor ve kullanıcılar dosyalarını yeniden indirmek zorunda kalıyordu. GGUF ise genişletilebilir meta veri yapısıyla geriye dönük uyumluluğu korur. Formatın en önemli özelliği niceleme (quantization) desteğidir. Niceleme, model ağırlıklarını 32 bitlik kayan nokta yerine daha az bit kullanan tam sayılarla temsil ederek dosya boyutunu ve bellek gereksinimini büyük ölçüde azaltır. Başlıca niceleme düzeyleri şunlardır: - **Q4_K_M**: 4 bit, orta ölçekli k-niceleme; kalite ile hız arasında iyi denge sağlar ve 7B modelleri için önerilen standarttır. - **Q5_K_M**: 5 bit, biraz daha yüksek doğruluk; disk alanı pahasına daha iyi çıktı üretir. - **Q8_0**: 8 bit; orijinal modele en yakın kaliteyi sunar, ancak dosya boyutu oldukça büyüktür. - **Q2_K**: 2 bit; bellek kısıtlı cihazlar için minimize edilmiş seçenek, ancak çıktı kalitesi belirgin düşer. GGUF dosyaları; llama.cpp, Ollama, LM Studio ve GPT4All gibi araçlarla sorunsuz çalışır. Bu araçlar, GGUF modellerini CPU ile çalıştırabilir, GPU katmanlarına kısmi yükleyebilir (GPU offloading) ya da Apple Silicon'ın Metal API'si aracılığıyla hızlandırabilir. Hugging Face Model Hub'da binlerce hazır GGUF dosyası barındırılmakta; topluluk tarafından dönüştürülmüş ve nicelenmiş modeller kolayca indirilebilmektedir. Alternatif formatlarla karşılaştırıldığında GGUF, taşınabilirlik açısından öne çıkar. GPTQ ve AWQ GPU odaklı niceleme formatları olduğundan CPU desteği sınırlıdır. Safetensors ise güvenli ve hızlı yükleme sunar ancak ayrı tokenizer dosyası gerektirir. GGUF'un tek dosya + CPU uyumluluğu yaklaşımı, lokal ve edge dağıtım senaryolarında onu özellikle avantajlı kılar.