Quantization (Kuantizasyon (Model Küçültme))

Sinir agi agirliklarini daha dusuk bit genisliginde temsil ederek model boyutunu ve hesaplama maliyetini dusuran sikistirma teknigi.

Quantization (niceleme), sinir agi modellerindeki parametre degerlerinin yuksek hassasiyetli sayisal formattan (genellikle 32-bit kayan nokta, float32) daha dusuk bit genisligine (8-bit tam sayi veya 4-bit gibi) donusturulme islemidir. Bu donusum model boyutunu kucultmesi, cikarim hizini artirmasi ve guc tuketimini dusurmesinin yaninda, modeli kaynak kisitli ortamlarda - ornegin akilli telefon veya kenarda calisabilen cihazlarda - calistirmaya olanak tanir. Nicelemenin temelinde bir uzlasim yatar: hassasiyet azaldikca model hafizasi ve hesaplama maliyeti duser, ancak tahmin kalitesi potansiyel olarak azalabilir. Uygulamada, ozellikle INT8 dzeyinde, bu kalite kaybi cogu gorev icin ihmal edilebilir seviyede kalir. GPTQ veya bitsandbytes gibi kutuphaneler, niceleme hatasini en aza indirmek icin kalibrasyon verisi kullanarak agirlik matrislerini yeniden optimize eder. Iki ana yaklasim mevcuttur. Post-Training Quantization (PTQ) halihazirda egitilmis bir modele uygulanir; ekstra egitim gerektirmez ve hizlidir. Quantization-Aware Training (QAT) ise niceleme etkisini eğitim dongusu icerisine dahil eder; model, daha dusuk hassasiyetle bile dogru tahmin uretmeyi ogrenir. QAT genellikle PTQ'ya kiyasla daha iyi nihai kalite sunar ama ek hesaplama maliyeti getirir. Buyuk dil modellerinin (LLM) giderek buyumesiyle quantization zorunlu bir pratik haline gelmistir. GPT-3 seviyesinde bir model tam hassasiyetle yuzlerce gigabayt RAM gerektirir; INT4 nicelemeyle bu rakam onlarca gigabayta iner ve ticarette satilan bir laptopla calistirmak mumkun olur. llama.cpp projesi ve GGUF formati, bu olasiligi genis bir topluluga acmistir: Q4_K_M, Q5_K_S gibi semboller bit genisligi ile kalite stratejisini kodlar. Donanim ekosistemi de nicelemeyi etkin sekilde destekler. NVIDIA'nin Tensor Core mimarisi INT8 ve FP8 cikarimini donanim katmaninda hizlandirir; bu sayede veri merkezi GPU'larinda ayni enerji butcesiyle cok daha yuksek islem hacmi elde edilir. Apple Silicon'un Unified Memory mimarisi ise CPU ve GPU'nun ayni bellek havuzunu paylasmasina izin vererek quantized LLM'lerin tuketu cihazlarda akici calismasi icin dogal bir avantaj sunar. **Sik Sorulan Sorular** **INT8 ile INT4 niceleme arasinda kalite farki buyuk mudur?** INT8, cogulukla ihmal edilebilir kalite kaybı uretir. INT4 ise modele ve goreve bagimlidir: genel dil anlama gorevlerinde sinirli etki gorulurken kucuk modeller veya hassas gorevlerde kayip daha belirgin olabilir. **Bir modeli niceleme yapmak icin ne gereklidir?** bitsandbytes veya AutoGPTQ kutuphanesiyle birkaç satirda Python kodla herhangi bir Hugging Face modeli niceleye bilirsiniz; kalibrasyon icin kucuk bir veri kumesi onerilen uygulamalardan biridir. **Quantization modelin egitim verilerini degistirir mi?** Hayir. Niceleme yalnizca cikarim asamasini etkiler; egitim verisi veya egitim sureci degismez. **Hangi modeller niceleye en uyundur?** Buyuk, asiri parametreli modeller genellikle niceleye daha direnclidir; parametreler arasinda islevsel fazlalik bulundugu icin bazi bilgi kaybi tolere edilebilir.

Quantization Nedir?

Quantization (niceleme), sinir agi agirliklarini float32 gibi yuksek hassasiyetli formattan INT8 veya INT4 gibi dusuk bit genisliklerine donusturme islemidir. Bu sayede model dosya boyutu 2 ila 8 kat kuculebi­lir; cikarim hizlanir ve guc tuketimi azalir. Uzlasim basittir: daha az bit, daha az kesinlik anlamina gelebilir; ancak modern nicileme algoritmalari bu kaybı cogul gorevlerde ihmal edilebilir duzeye indirger. Ozellikle buyuk dil modelleri icin quantization, modeli genis donanim yelpazesinde calistirabilmenin anahtaridir.

PTQ ve QAT: Iki Temel Yaklasim

Post-Training Quantization (PTQ), mevcut egitilmis bir modele uygulanir. Ek egitim gerektirmez; bir kalibrasyon veri kumesi uzerinden agirliklar optimize edilir. GPTQ ve bitsandbytes bu yaklasimin on plana cikan uygulamalaridir. Quantization-Aware Training (QAT) ise dusuk bit hassasiyetini egitim dongusu icerisine dahil eder. Model, nicileme hatalarini hesaplayarak parametrelerini buna gore ayarlar. Sonucta PTQ'ya kiyasla daha yuksek dogruluk elde edilir, ancak ekstra egitim maliyeti vardir. Egitim butcesi sinirli ekipler icin PTQ ilk tercih olmalidir.

LLM ve Yerel Cikarim

Buyuk dil modellerinin milyarlarca parametresi, tam hassasiyette devasa bellek gerektirir. Quantization bu engeli asmanin birincil yoludur. llama.cpp ve GGUF formati sayesinde 7B ile 70B parametre arali modeller, INT4 nicelemeyle kisisel bilgisayarlarda calistirabilir. GGUF dosya adindaki Q4_K_M veya Q8_0 gibi semboller, bit genisligini ve kalibrasyon stratejisini ifade eder. Kalite ile hiz arasindaki dogru dengeyi bulmak icin kullanim senaryosunu tanimlayip farkli niceleme duzeylerinde benchmark yapmak onerilen pratiktir.

Donanim Destegi ve Ekosistem

Modern AI donaniminin buyuk kismi nicilemeyi ilk sinif vatandas olarak destekler. NVIDIA Tensor Core'lari INT8 ve FP8 matris carpimlarini ozel devre bloklarinda hizlandirirken Qualcomm ve MediaTek mobil cipleri INT8 cikarimini dusuk gucle yurutebilir. Apple Silicon'un Unified Memory mimarisi CPU ve GPU'nun ayni fiziksel bellegi paylasmasi sayesinde quantized modelleri tuketu cihazlarda akici calistirir. Yazilim tarafinda Hugging Face Transformers, AutoGPTQ, bitsandbytes ve llama.cpp kutuphaneleri, nicilemeyi bir veya iki satir Python kodla erisebilir kilar.

Niceleme Yöntemleri Karşılaştırması

PTQ (Eğitim Sonrası)

Eğitilmiş modeli yeniden eğitmeden niceler; GPTQ ve AWQ popüler LLM nicemleme yöntemleridir.

QAT (Eğitim Farkındalıklı)

Eğitim sırasında niceleme simüle edilir; PTQ'ya göre genellikle daha yüksek doğruluk verir.

INT8 / INT4 Karşılaştırması

INT8 minimal doğruluk kaybı; INT4 daha büyük sıkıştırma ama kalite-hız dengesi dikkat ister.

Karma Hassasiyet

Hassas katmanlar FP16, geri kalanlar INT4; özgün kalite korunarak maksimum sıkıştırma sağlanır.

help Sik Sorulan Sorular

  • check_circle INT8 ile INT4 niceleme arasinda kalite farki buyuk mudur? INT8 cogulukla ihmal edilebilir kalite kaybi uretir. INT4 ise modele ve goreve bagimlidir: genel dil anlama gorevlerinde sinirli etki gorulurken kucuk modeller veya hassas gorevlerde kayip daha belirgin olabilir.
  • check_circle Bir modeli niceleme yapmak icin ne gereklidir? bitsandbytes veya AutoGPTQ kutuphanesiyle birkaç satirda Python kodu yeterlidir; kalibrasyon icin kucuk bir veri kumesi onerilen uygulamalardan biridir.
  • check_circle Quantization modelin egitim verilerini degistirir mi? Hayir. Niceleme yalnizca cikarim asamasini etkiler; egitim verisi veya egitim sureci degismez.
  • check_circle Hangi modeller niceleye en uyundur? Buyuk, asiri parametreli modeller genellikle niceleye daha direnclidir; parametreler arasinda islevsel fazlalik bulundugu icin bazi bilgi kaybi tolere edilebilir.