Quantization Nedir?
Quantization (niceleme), sinir agi agirliklarini float32 gibi yuksek hassasiyetli formattan INT8 veya INT4 gibi dusuk bit genisliklerine donusturme islemidir. Bu sayede model dosya boyutu 2 ila 8 kat kuculebilir; cikarim hizlanir ve guc tuketimi azalir. Uzlasim basittir: daha az bit, daha az kesinlik anlamina gelebilir; ancak modern nicileme algoritmalari bu kaybı cogul gorevlerde ihmal edilebilir duzeye indirger. Ozellikle buyuk dil modelleri icin quantization, modeli genis donanim yelpazesinde calistirabilmenin anahtaridir.
PTQ ve QAT: Iki Temel Yaklasim
Post-Training Quantization (PTQ), mevcut egitilmis bir modele uygulanir. Ek egitim gerektirmez; bir kalibrasyon veri kumesi uzerinden agirliklar optimize edilir. GPTQ ve bitsandbytes bu yaklasimin on plana cikan uygulamalaridir. Quantization-Aware Training (QAT) ise dusuk bit hassasiyetini egitim dongusu icerisine dahil eder. Model, nicileme hatalarini hesaplayarak parametrelerini buna gore ayarlar. Sonucta PTQ'ya kiyasla daha yuksek dogruluk elde edilir, ancak ekstra egitim maliyeti vardir. Egitim butcesi sinirli ekipler icin PTQ ilk tercih olmalidir.
LLM ve Yerel Cikarim
Buyuk dil modellerinin milyarlarca parametresi, tam hassasiyette devasa bellek gerektirir. Quantization bu engeli asmanin birincil yoludur. llama.cpp ve GGUF formati sayesinde 7B ile 70B parametre arali modeller, INT4 nicelemeyle kisisel bilgisayarlarda calistirabilir. GGUF dosya adindaki Q4_K_M veya Q8_0 gibi semboller, bit genisligini ve kalibrasyon stratejisini ifade eder. Kalite ile hiz arasindaki dogru dengeyi bulmak icin kullanim senaryosunu tanimlayip farkli niceleme duzeylerinde benchmark yapmak onerilen pratiktir.
Donanim Destegi ve Ekosistem
Modern AI donaniminin buyuk kismi nicilemeyi ilk sinif vatandas olarak destekler. NVIDIA Tensor Core'lari INT8 ve FP8 matris carpimlarini ozel devre bloklarinda hizlandirirken Qualcomm ve MediaTek mobil cipleri INT8 cikarimini dusuk gucle yurutebilir. Apple Silicon'un Unified Memory mimarisi CPU ve GPU'nun ayni fiziksel bellegi paylasmasi sayesinde quantized modelleri tuketu cihazlarda akici calistirir. Yazilim tarafinda Hugging Face Transformers, AutoGPTQ, bitsandbytes ve llama.cpp kutuphaneleri, nicilemeyi bir veya iki satir Python kodla erisebilir kilar.
Niceleme Yöntemleri Karşılaştırması
PTQ (Eğitim Sonrası)
Eğitilmiş modeli yeniden eğitmeden niceler; GPTQ ve AWQ popüler LLM nicemleme yöntemleridir.
QAT (Eğitim Farkındalıklı)
Eğitim sırasında niceleme simüle edilir; PTQ'ya göre genellikle daha yüksek doğruluk verir.
INT8 / INT4 Karşılaştırması
INT8 minimal doğruluk kaybı; INT4 daha büyük sıkıştırma ama kalite-hız dengesi dikkat ister.
Karma Hassasiyet
Hassas katmanlar FP16, geri kalanlar INT4; özgün kalite korunarak maksimum sıkıştırma sağlanır.
help Sik Sorulan Sorular
- check_circle INT8 ile INT4 niceleme arasinda kalite farki buyuk mudur? INT8 cogulukla ihmal edilebilir kalite kaybi uretir. INT4 ise modele ve goreve bagimlidir: genel dil anlama gorevlerinde sinirli etki gorulurken kucuk modeller veya hassas gorevlerde kayip daha belirgin olabilir.
- check_circle Bir modeli niceleme yapmak icin ne gereklidir? bitsandbytes veya AutoGPTQ kutuphanesiyle birkaç satirda Python kodu yeterlidir; kalibrasyon icin kucuk bir veri kumesi onerilen uygulamalardan biridir.
- check_circle Quantization modelin egitim verilerini degistirir mi? Hayir. Niceleme yalnizca cikarim asamasini etkiler; egitim verisi veya egitim sureci degismez.
- check_circle Hangi modeller niceleye en uyundur? Buyuk, asiri parametreli modeller genellikle niceleye daha direnclidir; parametreler arasinda islevsel fazlalik bulundugu icin bazi bilgi kaybi tolere edilebilir.