tag GPTQ
Bu sayfada GPTQ etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
GPTQ (Generative Pre-trained Transformer Quantization), büyük dil modellerini INT4 veya INT8 bit genişliğine kuantize etmek için ikinci dereceden bilgi (Hessian matrisini) kullanan post-training weight quantization algoritmasıdır. Frans Frantar ve ekibi tarafından 2022'de ETH Zürich'te geliştirilen GPTQ, Optimal Brain Compression (OBC) algoritmasının büyük ölçeğe uyarlanmış ve önemli ölçüde hızlandırılmış bir versiyonudur; OBC'nin O(d³) karmaşıklığını O(d²) seviyesine indiren yenilikçi Cholesky dekompoziyon tekniği, algoritmayı 175B parametreli modellere kadar uygulanabilir kılar. Algoritma, model ağırlıklarını katman katman, küçük bloklar hâlinde (tipik olarak 128 sütun) işler. Her blok için Hessian matrisinin tersini hesaplar ve kuantizasyon hatasını sonraki sütunlara yayarak global hatayı minimize eder. Bu süreçte yalnızca 128-512 örnekten oluşan küçük bir kalibrasyon veri seti kullanılır; tam eğitim gerektirmeyen bu yaklaşım, yüz milyar parametreli modeller için bile dakikalar içinde tamamlanabilir. Pratik etki belirgindir: 70 milyar parametreli bir model FP16'da yaklaşık 140 GB GPU belleği gerektirirken, GPTQ INT4 kuantizasyonu bu gereksinimi ~35 GB'a düşürür. Böylece 70B modeller, 24 GB VRAM'li tüketici sınıfı GPU'larda (RTX 4090 gibi) çalışabilir hale gelir. LLaMA 3 70B üzerinde yapılan karşılaştırmalarda GPTQ INT4 modeli, FP16 referansına göre yalnızca %2-3 puanlık MMLU kaybıyla üretim kalitesini koruyabilmektedir. GPTQ ekosistemi hızla genişlemiştir: AutoGPTQ ve ExLlamaV2 kütüphaneleri, vLLM ve HuggingFace Transformers doğrudan GPTQ formatını destekler. HuggingFace Hub'da '*-GPTQ' etiketi taşıyan binlerce hazır model mevcuttur. EXL2 formatı, GPTQ'nun katman başına farklı bit genişliği destekleyen gelişmiş bir türevidir ve daha iyi kalite-boyut dengesi sunar. Temel rakip yöntemler AWQ (aktivasyon farkındalıklı ağırlık kuantizasyonu) ve GGUF/llama.cpp'dir; AWQ genellikle daha hızlı çıkarım hızı sağlarken GPTQ bazı görevlerde daha iyi kalite korur; GGUF ise CPU ve Apple Silicon cihazlarında tercih edilen formattır.
AWQ (Aktivasyon Duyarlı Ağırlık Kuantizasyonu)
AWQ (Activation-aware Weight Quantization), buyuk dil modellerini INT4 tam sayi hassasiyetine nicelerken agirlik onem skorlarini kullanarak kalite kaybini minimize eden bir quantization yontemidir. 2023 yilinda MIT Han Lab tarafindan gelistirilmistir. AWQ'nun temel icgudusuu sunudur: bir sinir agindaki tum agirlik kanallari esit onemde degildir. Aktivasyon buyuklugu yuksek olan kanallar, modelin cikti kalitesine daha buyuk katki saglar; bu kanallar nicelerseniz kalite kaybini da buyuk olur. AWQ bu gozlemden yola cikarak her kanali esit sekilde nicielemek yerine kritik kanallari korur. Teknik olarak her agirlik kanalinin aktivasyonlarla olan baglantisini hesaplar ve yuksek onemli kanallara daha buyuk olcekleme faktoru uygular; bu sayede hata gercek INT4 hatayina cok yakin bir noktada tutulur ancak kritik bilgi kaybi onlenir. GPTQ, buyuk dil modeli quantization alaninin diger onemli yontemidir ve ikinci derece Hessian matris optimizasyonu kullanir. AWQ ise daha sade bir olcekleme yaklasimiyla hesaplama maliyetini dusurup donanim dostu bir format uretir; bu nedenle cikarim hizi acisindan GPTQ'ya kiyasla avantaj saglar. Pratik uygulamada AutoAWQ kutuphanesi Hugging Face model deposunun herhangi bir modelini AWQ formatina donusturmek icin birkaç satirla Python kodu yeterlidir. vLLM ve TensorRT-LLM gibi populer cikarim cerceveleri AWQ formatini natively destekler. Bu ozellik, AWQ'yu ozellikle buyuk dil modellerini yerel sunucularda veya kenarda calistirmak isteyen organizasyonlar icin pratik bir tercih yapar. Apple Silicon, NVIDIA GPU'lar ve kucuk olcekli cikarim odakli donanim (Jetson gibi) uzerinde AWQ tutarli performans artisi saglar. INT4 nicileme, float32'ye kiyasla yaklasik dort kat daha az GPU bellek kullanir; bu da buyuk modelleri daha kucuk donanim konfigurasyon uzerinde calistirmayi mumkun kilar. **Sik Sorulan Sorular** **AWQ ile GPTQ arasindaki fark nedir?** GPTQ ikinci derece Hessian optimizasyonu kullanir; AWQ ise aktivasyon onem skoru temelli daha basit bir yaklasim izler. AWQ genellikle daha hizli cikarim saglarken GPTQ bazi benchmark'larda daha yuksek dogruluk sergileyebilir. **AWQ modelleri nerede bulunabilir?** Hugging Face Hub'da pek cok populer model icin AWQ formatli surumler mevcuttur; arama cubuguna modelin adi ve 'AWQ' yazarak bulunabilir. AutoAWQ kutuphanesiyle kendi modeli donusturme de mumkundur. **AWQ hangi model boyutlarinda en etkilidir?** 7B ile 70B parametre arasi modellerde INT4 AWQ en pratik dengeyi sunar. Daha kucuk modellerde kalite kaybi daha belirgin olabilir; cok buyuk modellerde ise bellek tasarrufunu acikca hissedilir. **vLLM ile AWQ modeller calistirilabilir mi?** Evet, vLLM AWQ formatini natively destekler ve yuksek verimliligi batch cikarimi ile AWQ modellerini verimli sekilde sunabilir.
GPTQ (İkinci Dereceden LLM Kuantizasyonu)
GPTQ (Generative Pre-trained Transformer Quantization), büyük dil modellerini INT4 veya INT8 bit genişliğine kuantize etmek için ikinci dereceden bilgi (Hessian matrisini) kullanan post-training weight quantization algoritmasıdır. Frans Frantar ve ekibi tarafından 2022'de ETH Zürich'te geliştirilen GPTQ, Optimal Brain Compression (OBC) algoritmasının büyük ölçeğe uyarlanmış ve önemli ölçüde hızlandırılmış bir versiyonudur; OBC'nin O(d³) karmaşıklığını O(d²) seviyesine indiren yenilikçi Cholesky dekompoziyon tekniği, algoritmayı 175B parametreli modellere kadar uygulanabilir kılar. Algoritma, model ağırlıklarını katman katman, küçük bloklar hâlinde (tipik olarak 128 sütun) işler. Her blok için Hessian matrisinin tersini hesaplar ve kuantizasyon hatasını sonraki sütunlara yayarak global hatayı minimize eder. Bu süreçte yalnızca 128-512 örnekten oluşan küçük bir kalibrasyon veri seti kullanılır; tam eğitim gerektirmeyen bu yaklaşım, yüz milyar parametreli modeller için bile dakikalar içinde tamamlanabilir. Pratik etki belirgindir: 70 milyar parametreli bir model FP16'da yaklaşık 140 GB GPU belleği gerektirirken, GPTQ INT4 kuantizasyonu bu gereksinimi ~35 GB'a düşürür. Böylece 70B modeller, 24 GB VRAM'li tüketici sınıfı GPU'larda (RTX 4090 gibi) çalışabilir hale gelir. LLaMA 3 70B üzerinde yapılan karşılaştırmalarda GPTQ INT4 modeli, FP16 referansına göre yalnızca %2-3 puanlık MMLU kaybıyla üretim kalitesini koruyabilmektedir. GPTQ ekosistemi hızla genişlemiştir: AutoGPTQ ve ExLlamaV2 kütüphaneleri, vLLM ve HuggingFace Transformers doğrudan GPTQ formatını destekler. HuggingFace Hub'da '*-GPTQ' etiketi taşıyan binlerce hazır model mevcuttur. EXL2 formatı, GPTQ'nun katman başına farklı bit genişliği destekleyen gelişmiş bir türevidir ve daha iyi kalite-boyut dengesi sunar. Temel rakip yöntemler AWQ (aktivasyon farkındalıklı ağırlık kuantizasyonu) ve GGUF/llama.cpp'dir; AWQ genellikle daha hızlı çıkarım hızı sağlarken GPTQ bazı görevlerde daha iyi kalite korur; GGUF ise CPU ve Apple Silicon cihazlarında tercih edilen formattır.