Kuantizasyon Neden Gerekli?
Modern büyük dil modelleri onlarca ila yüzlerce milyar parametre içerir. FP32 formatında GPT-3'ün 175 milyar parametresi yaklaşık 700 GB yer kaplar; bu, on adet üst segmen GPU gerektiren bir kapasitedir. FP16'ya geçiş bunu yarıya indirir. INT8 kuantizasyon dörtte bire, INT4 ise sekizde bire düşürür. Bu matematiksel sıkıştırma sayesinde 7B-13B parametreli modeller sıradan bir tüketici dizüstü bilgisayarında çalışır hale gelir; veri merkezi GPU'larına bağımlılık azalır, çıkarım gecikmesi düşer ve enerji tüketimi azalır. Edge cihazlarda (akıllı telefon, gömülü sistem) yapay zeka yürütme ancak kuantizasyon ile mümkün olmaktadır.
PTQ ve QAT: İki Temel Yaklaşım
Eğitim Sonrası Kuantizasyon (PTQ), eğitilmiş bir modeli yeniden eğitim yapmadan dönüştürür. Küçük bir kalibrasyon veri seti üzerinde aktivasyon dağılımları ölçülür, ağırlıklar INT8/INT4'e yuvarlama ile haritalanır. Süreç hızlı ve düşük maliyetlidir; büyük LLM'lerin çoğu PTQ ile yeterli doğruluk kaybıyla kuantize edilir. GPTQ ve AWQ, katman bazında ikinci dereceden optimizasyon ile INT4 doğruluğunu PTQ'ya göre önemli ölçüde iyileştirir. Kuantizasyon Farkındalıklı Eğitim (QAT), eğitim grafiğine sahte kuantizasyon düğümleri ekleyerek modelin düşük hassasiyeti öğrenmesini sağlar. Daha fazla hesaplama gerektirmesine karşın genellikle PTQ'dan daha iyi doğruluk üretir; özellikle küçük modellerde ve uç durumlarında tercih edilir.
GPTQ, AWQ ve GGUF: Popüler Formatlar
GPTQ (Frantar et al., 2022), Optimal Brain Quantization ilkesinden türetilen bir PTQ yöntemidir. Her katmanı sırayla minimize eden bir hata azaltma optimizasyonu uygular; özellikle Llama ve Mistral tabanlı modeller için yaygın kullanılır. AWQ (Lin et al., 2023) aktivasyon ağırlıklı bir kuantizasyon yaklaşımıdır; saliency-aware analiz ile hangi kanalların korunması gerektiğini belirler ve GPTQ'ya kıyasla benzer veya daha iyi doğruluk üretir. GGUF formatı (llama.cpp ekosistemi), CPU ve hibrit CPU+GPU çıkarımı için optimize edilmiş bir depolama biçimidir; Ollama, LM Studio ve Jan bu formatı kullanır. bitsandbytes, Hugging Face Transformers ile entegre çalışır ve 8-bit/4-bit kuantizasyonu Python üzerinden kolayca kullanıma sunar.
Doğruluk-Verimlilik Ödünleşimi
INT8 kuantizasyon, büyük modellerde FP32/FP16'ya kıyasla genellikle perplexity açısından %1'den az bozunum gösterir ve çoğu üretim senaryosu için yeterlidir. INT4 kuantizasyon daha belirgin bir doğruluk kaybına yol açabilir; ancak GPTQ ve AWQ gibi kalibrasyonlu yöntemler bu kaybı minimuma indirir. Genel kural: model büyüdükçe kuantizasyona dayanıklılık artar — 70B model INT4'e 7B modele kıyasla çok daha dirençlidir. Görev türü de önemlidir: matematiksel akıl yürütme ve hassas olgusal üretim gerektiren görevlerde INT4 daha fazla bozunum gösterebilirken, genel metin üretme ve sohbet görevlerinde fark kullanıcılar tarafından fark edilmeyebilir.
Yerel LLM ve Edge AI'da Kullanım
Kuantizasyon, yerel yapay zeka devriminin temel teknolojisidir. Llama 3.1 8B modeli FP16'da ~16 GB VRAM gerektirirken, Q4_K_M GGUF kuantizasyonuyla ~5 GB'a iner ve 8 GB RAM'li bir dizüstü bilgisayarda CPU üzerinde çalışabilir. Ollama bu modelleri tek komutla indirip çalıştırır. Apple Silicon (M1/M2/M3) MPS backend'i INT8 ve INT4 çıkarımını birleşik bellek mimarisiyle hızlandırır. Akıllı telefon tarafında Samsung Exynos ve Qualcomm Snapdragon NPU'ları INT8 modellerini on-device çalıştırmak üzere optimize edilmiştir. 2024-2026'da Microsoft BitNet 1-bit ağırlıklarla rekabetçi dil modeli kalitesi elde etmeyi araştırmakta; bu, geleneksel kuantizasyonun sınırlarını zorlamaktadır.
Sıkça Sorulan Sorular
- check_circle :
- check_circle :
- check_circle :
- check_circle :
- check_circle :