Model Quantization (Model Kuantizasyonu — Ağırlık Hassasiyet Azaltma)

Model kuantizasyonu, sinir ağı ağırlıklarını ve aktivasyonlarını yüksek hassasiyetli kayan nokta formatından (FP32/FP16) düşük bitli tam sayı gösterimlerine (INT8/INT4) dönüştürerek bellek kullanımını ve çıkarım gecikmesini önemli ölçüde azaltan model sıkıştırma tekniğidir.

Model kuantizasyonu (Model Quantization), büyük yapay zeka modellerinin ağırlık ve aktivasyon değerlerini yüksek hassasiyetli kayan noktalı sayılardan (FP32, FP16) daha düşük bitli tam sayı gösterimlerine (INT8, INT4, hatta INT2) dönüştüren bir model sıkıştırma tekniğidir. Bu dönüşüm, modelin bellek ayak izini küçültür, çıkarım hızını artırır ve daha az enerji tüketerek Edge cihazlarda veya tüketici donanımlarında büyük dil modellerinin çalıştırılmasını mümkün kılar. Temel fikir şudur: bir FP32 değer 4 bayt kaplarken INT8 yalnızca 1 bayt, INT4 ise yarım bayt kullanır. 7 milyar parametreli bir LLM FP16 olarak yaklaşık 14 GB VRAM gerektirirken, INT4 kuantizasyonuyla bu ihtiyaç ~4 GB'a düşer ve sıradan bir tüketici GPU'sunda çalışır hale gelir. Başlıca kuantizasyon yaklaşımları şunlardır: **Eğitim Sonrası Kuantizasyon (PTQ — Post-Training Quantization)**, eğitilmiş modeli yeniden eğitmeden doğrudan dönüştürür; GPTQ, AWQ ve llama.cpp bu yöntemi kullanır. **Kuantizasyon Farkındalıklı Eğitim (QAT — Quantization-Aware Training)** ise eğitim sırasında kuantizasyon hatasını simüle ederek daha yüksek doğruluk sunar ancak ek hesaplama maliyeti gerektirir. Bunlara ek olarak **GGUF/GGML formatları** (llama.cpp ekosistemi), **bitsandbytes** (Hugging Face entegrasyonu) ve **ONNX Runtime** kuantize modelleri verimli çalıştıran araçlardır. Kuantizasyonun temel ödünleşimi doğruluk ile verimlilik arasındadır. INT8 genellikle FP32'ye kıyasla %1'in altında doğruluk kaybıyla son derece iyi çalışır. INT4 daha yüksek kayıp gösterebilir; ancak GPTQ ve AWQ gibi kalibrasyonlu yöntemler bu kaybı perplexity açısından ihmal edilebilir düzeyde tutar. Model boyutu ve görev karmaşıklığı arttıkça kuantizasyona dayanıklılık artma eğiliminde olduğu için büyük LLM'ler küçük modellere göre daha az bozunumla kuantize edilir. Pratik kullanımda Ollama, LM Studio ve Jan gibi yerel LLM araçları modellerini GGUF formatında INT4/INT8 kuantize olarak sunar. Hugging Face Hub'da TheBloke gibi topluluk hesapları yaygın modelleri GGUF ve AWQ kuantizasyonlarıyla yayımlar. 2024-2026 döneminde Microsoft'un BitNet gibi deneysel mimarileri 1-bit kuantizasyonu araştırırken, Apple Silicon'ın ANE birimi INT4 çıkarımını CPU/GPU hibrit olarak verimli gerçekleştirir.

Kuantizasyon Neden Gerekli?

Modern büyük dil modelleri onlarca ila yüzlerce milyar parametre içerir. FP32 formatında GPT-3'ün 175 milyar parametresi yaklaşık 700 GB yer kaplar; bu, on adet üst segmen GPU gerektiren bir kapasitedir. FP16'ya geçiş bunu yarıya indirir. INT8 kuantizasyon dörtte bire, INT4 ise sekizde bire düşürür. Bu matematiksel sıkıştırma sayesinde 7B-13B parametreli modeller sıradan bir tüketici dizüstü bilgisayarında çalışır hale gelir; veri merkezi GPU'larına bağımlılık azalır, çıkarım gecikmesi düşer ve enerji tüketimi azalır. Edge cihazlarda (akıllı telefon, gömülü sistem) yapay zeka yürütme ancak kuantizasyon ile mümkün olmaktadır.

PTQ ve QAT: İki Temel Yaklaşım

Eğitim Sonrası Kuantizasyon (PTQ), eğitilmiş bir modeli yeniden eğitim yapmadan dönüştürür. Küçük bir kalibrasyon veri seti üzerinde aktivasyon dağılımları ölçülür, ağırlıklar INT8/INT4'e yuvarlama ile haritalanır. Süreç hızlı ve düşük maliyetlidir; büyük LLM'lerin çoğu PTQ ile yeterli doğruluk kaybıyla kuantize edilir. GPTQ ve AWQ, katman bazında ikinci dereceden optimizasyon ile INT4 doğruluğunu PTQ'ya göre önemli ölçüde iyileştirir. Kuantizasyon Farkındalıklı Eğitim (QAT), eğitim grafiğine sahte kuantizasyon düğümleri ekleyerek modelin düşük hassasiyeti öğrenmesini sağlar. Daha fazla hesaplama gerektirmesine karşın genellikle PTQ'dan daha iyi doğruluk üretir; özellikle küçük modellerde ve uç durumlarında tercih edilir.

GPTQ, AWQ ve GGUF: Popüler Formatlar

GPTQ (Frantar et al., 2022), Optimal Brain Quantization ilkesinden türetilen bir PTQ yöntemidir. Her katmanı sırayla minimize eden bir hata azaltma optimizasyonu uygular; özellikle Llama ve Mistral tabanlı modeller için yaygın kullanılır. AWQ (Lin et al., 2023) aktivasyon ağırlıklı bir kuantizasyon yaklaşımıdır; saliency-aware analiz ile hangi kanalların korunması gerektiğini belirler ve GPTQ'ya kıyasla benzer veya daha iyi doğruluk üretir. GGUF formatı (llama.cpp ekosistemi), CPU ve hibrit CPU+GPU çıkarımı için optimize edilmiş bir depolama biçimidir; Ollama, LM Studio ve Jan bu formatı kullanır. bitsandbytes, Hugging Face Transformers ile entegre çalışır ve 8-bit/4-bit kuantizasyonu Python üzerinden kolayca kullanıma sunar.

Doğruluk-Verimlilik Ödünleşimi

INT8 kuantizasyon, büyük modellerde FP32/FP16'ya kıyasla genellikle perplexity açısından %1'den az bozunum gösterir ve çoğu üretim senaryosu için yeterlidir. INT4 kuantizasyon daha belirgin bir doğruluk kaybına yol açabilir; ancak GPTQ ve AWQ gibi kalibrasyonlu yöntemler bu kaybı minimuma indirir. Genel kural: model büyüdükçe kuantizasyona dayanıklılık artar — 70B model INT4'e 7B modele kıyasla çok daha dirençlidir. Görev türü de önemlidir: matematiksel akıl yürütme ve hassas olgusal üretim gerektiren görevlerde INT4 daha fazla bozunum gösterebilirken, genel metin üretme ve sohbet görevlerinde fark kullanıcılar tarafından fark edilmeyebilir.

Yerel LLM ve Edge AI'da Kullanım

Kuantizasyon, yerel yapay zeka devriminin temel teknolojisidir. Llama 3.1 8B modeli FP16'da ~16 GB VRAM gerektirirken, Q4_K_M GGUF kuantizasyonuyla ~5 GB'a iner ve 8 GB RAM'li bir dizüstü bilgisayarda CPU üzerinde çalışabilir. Ollama bu modelleri tek komutla indirip çalıştırır. Apple Silicon (M1/M2/M3) MPS backend'i INT8 ve INT4 çıkarımını birleşik bellek mimarisiyle hızlandırır. Akıllı telefon tarafında Samsung Exynos ve Qualcomm Snapdragon NPU'ları INT8 modellerini on-device çalıştırmak üzere optimize edilmiştir. 2024-2026'da Microsoft BitNet 1-bit ağırlıklarla rekabetçi dil modeli kalitesi elde etmeyi araştırmakta; bu, geleneksel kuantizasyonun sınırlarını zorlamaktadır.

Sıkça Sorulan Sorular

  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :
  • check_circle :