Transformers Artık llama.cpp GGUF Modellerini Çalıştırıyor — yapay zeka haberi
newspaper Haber edit_note yapayzekasozluk.tr Haber Masası schedule 23 Eylül 2026 · 06:11 timer 4 dk okuma

Transformers Artık llama.cpp GGUF Modellerini Çalıştırıyor

Hugging Face, Transformers kütüphanesine GGUF desteği ekledi. Artık llama.cpp kuantize modelleri doğrudan Python ve PyTorch üzerinden, Apple Silicon'da yüksek performansla çalıştırılabiliyor.

Transformers'a GGUF Desteği Geldi

Hugging Face, popüler makine öğrenmesi kütüphanesi Transformers'a GGUF (GPT-Generated Unified Format) desteği eklediğini duyurdu. Bu gelişme, yerel yapay zeka (local AI) araçlarında sıkça kullanılan llama.cpp tarafından geliştirilen GGUF formatındaki kuantize modellerin artık doğrudan Transformers API'si üzerinden çalıştırılabilmesi anlamına geliyor. Böylece geliştiriciler, daha önce yalnızca llama.cpp ekosisteminde mümkün olan yerel çıkarım (inference) deneyimini Python ve PyTorch ortamına taşıyabiliyor.

llama.cpp, Ollama, LM Studio ve Jan gibi yerel yapay zeka araçlarının arkasındaki çıkarım motoru olarak biliniyor. MLX gibi projelerle birlikte, dizüstü bilgisayarlarda yapay zeka modellerini çalıştırmayı günlük kullanım için pratik hale getirdi. Hugging Face'in bu hamlesi, iki güçlü ekosistemi birbirine yakınlaştırarak yerel çıkarımı daha erişilebilir kılmayı amaçlıyor.

GGUF Formatı ve Kuantizasyon

GGUF, model ağırlıklarını ve meta verileri (tokenizer bilgisi ve isteğe bağlı sohbet şablonu dahil) tek bir dosyada paketleyen bir format. Farklı kuantizasyon seviyelerini destekleyerek, belirli bir hassasiyet kaybı karşılığında daha küçük bellek ayak izi sunuyor. Örneğin Q4_K_M gibi varyantlar, çoğunlukla 4-bit ağırlıklar kullanırken hassas tensörleri daha yüksek hassasiyette tutarak dengeli bir performans sağlıyor.

Hugging Face Hub'da Unsloth, LM Studio Community ve bartowski gibi yayıncılar, çeşitli kuantizasyon seviyelerinde kullanıma hazır GGUF kontrol noktaları sunuyor. Kullanıcılar makinelerine uygun sürümü seçebiliyor. GGUF modelleri şimdiye kadar milyonlarca kez indirildi; bu da formatın ne kadar yaygın benimsendiğini gösteriyor.

Nasıl Çalışıyor?

Transformers'ta GGUF modeli yüklemek için `from_pretrained` fonksiyonuna model kimliği ve dosya adını `gguf_file` parametresiyle geçirmek yeterli. Ek yapılandırma gerekmiyor: ağırlıklar Metal üzerinde paketli kaldığında Transformers otomatik olarak uyumlu ggml/Metal çekirdeklerini yüklüyor ve dikkat (attention) mekanizması için ggml-org/ggml-attn kullanıyor. Eğer bu çekirdek alınamazsa, model "sdpa" ile geri düşüyor ve kullanıcı `attn_implementation="sdpa"` parametresiyle bunu zorlayabiliyor.

Örnek kullanım şu şekilde:

```python import torch from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "unsloth/Qwen3.5-4B-GGUF" filename = "Qwen3.5-4B-Q4_K_M.gguf"

tokenizer = AutoTokenizer.from_pretrained(model_id, gguf_file=filename) model = AutoModelForCausalLM.from_pretrained(model_id, gguf_file=filename) ```

Bu adımdan sonrası standart Transformers API'siyle aynı. Ayrıca `transformers serve` komutuyla OpenAI uyumlu bir API uç noktası da oluşturulabiliyor. Model argümanı `:.gguf` biçiminde belirtiliyor.

Performans ve llama.cpp Karşılaştırması

Hugging Face, Transformers'ın yerel çıkarım performansını llama.cpp'ye yaklaştırmak için ggml çekirdeklerini `kernels` kütüphanesi aracılığıyla yeniden kullanıyor ve `generate` fonksiyonundaki ek yükü azaltıyor. İlk odak, Apple Silicon üzerinde yerel çıkarım ve Qwen3.5 mimarisi.

Karşılaştırma, üç GGUF kontrol noktası üzerinde yapılmış: küçük yoğun (dense) model, daha büyük yoğun model ve bir uzman karışımı (MoE) model. llama.cpp tarafı `llama-bench` aracıyla ölçülürken, Transformers tarafı `generate` ile 128 token üretimi üzerinden değerlendirilmiş. Ölçümler MacBook Pro M2 Max, 32 GB birleşik bellek, macOS 26.6, PyTorch 2.12.1 ve kernels 0.17.0 ile yapılmış. Sonuçlar, Transformers'ın üç kontrol noktasında da llama.cpp'ye yakın performans sergilediğini gösteriyor.

Ancak not edilmesi gereken bir fark var: Transformers ölçümü ön doldurma (prefill) içerirken, llama-bench yalnızca kod çözme (decode) hızını raporluyor. Yine de sonuçlar umut verici.

Sınırlamalar ve Gelecek Planları

İlk hedef, Apple Silicon'da tek bir etkileşimli sohbet. Ancak bazı sınırlamalar mevcut:

  • Paketli çıkarım yolu şimdilik yalnızca MPS'de çalışıyor. GGUF içe aktarma, kuantizasyon çözme yoluyla ayrı bir seçenek olarak kalıyor.
  • Dolgu (padding) ve toplu işleme (batching) hâlâ geliştirilmesi gereken alanlar. Dolgusuz girdiler maske optimizasyonundan faydalanırken, dolgulu gruplar aynı kısayolu kullanamıyor.
  • Mimari kapsamı sınırlı: Paketli yükleyici şu anda Qwen3.5 yoğun ve MoE mimarilerini, uyumlu Qwen3.8 kontrol noktaları dahil olmak üzere destekliyor. Diğer mimariler için destek kademeli olarak genişletilecek.

Hugging Face, kullanıcıların Transformers'ta kullanmak istedikleri GGUF modelleri için sorun (issue) açmalarını teşvik ediyor. Bu geri bildirim, hangi modellere öncelik verileceğini belirlemede yardımcı olacak.

Neden Önemli?

Bu gelişme, yerel yapay zeka ekosistemi için önemli bir adım. Öncelikle, geliştiriciler artık GGUF modellerini Python ve PyTorch ortamında deneyebilir, ara aktivasyonları inceleyebilir, özel katmanlar prototipleyebilir ve mevcut Transformers değerlendirme iş akışlarını kullanarak kuantize modellerin kalitesini ölçebilir. Ayrıca GGUF dönüşümlerini doğrulamak, yeni kod çözme fikirlerini denemek ve hatta GGUF kontrol noktalarından ince ayar (fine-tuning) yapmak mümkün hale geliyor.

Daha büyük fırsat ise ggml'in performansını llama.cpp'nin desteklemediği modellere taşımak. Transformers, bu mimarilerin PyTorch uygulamalarını zaten sağlıyor. ggml çekirdekleri ve kuantizasyon şemaları PyTorch'ta mevcut olduğunda, tüm modeli llama.cpp'de yeniden uygulamaya gerek kalmadan desteklenen işlemleri hızlandırmak mümkün. Bu özellikle yeni mimariler, araştırma modelleri ve özel varyantlar için değerli.

Türkiye'deki geliştiriciler ve yapay zeka meraklıları için de bu haber umut verici. Apple Silicon Mac'lerde yerel olarak büyük dil modellerini çalıştırmak artık daha erişilebilir ve performanslı. Özellikle veri gizliliği ve düşük gecikme gerektiren uygulamalar için yerel çıkarım büyük önem taşıyor. Transformers'ın GGUF desteği, bu alanda çalışan Türk geliştiricilerin işini kolaylaştıracak ve yerel yapay zeka uygulamalarının yaygınlaşmasına katkı sağlayacak.

Hugging Face'in bu adımı, llama.cpp'nin gücünü Transformers'ın esnekliğiyle birleştirerek yerel yapay zeka ekosistemini daha da güçlendiriyor. Önümüzdeki dönemde diğer mimarilerin ve platformların da eklenmesiyle bu entegrasyonun daha da genişlemesi bekleniyor.

link Kaynak: HuggingFace
tag Hugging Face tag Transformers tag llama.cpp tag GGUF tag yerel yapay zeka tag kuantizasyon

İlgili Terimler

8 terim