tag AWQ
Bu sayfada AWQ etiketi ile işaretlenmiş 1 yapay zeka kavramını bulabilirsiniz.
AWQ (Activation-aware Weight Quantization), buyuk dil modellerini INT4 tam sayi hassasiyetine nicelerken agirlik onem skorlarini kullanarak kalite kaybini minimize eden bir quantization yontemidir. 2023 yilinda MIT Han Lab tarafindan gelistirilmistir. AWQ'nun temel icgudusuu sunudur: bir sinir agindaki tum agirlik kanallari esit onemde degildir. Aktivasyon buyuklugu yuksek olan kanallar, modelin cikti kalitesine daha buyuk katki saglar; bu kanallar nicelerseniz kalite kaybini da buyuk olur. AWQ bu gozlemden yola cikarak her kanali esit sekilde nicielemek yerine kritik kanallari korur. Teknik olarak her agirlik kanalinin aktivasyonlarla olan baglantisini hesaplar ve yuksek onemli kanallara daha buyuk olcekleme faktoru uygular; bu sayede hata gercek INT4 hatayina cok yakin bir noktada tutulur ancak kritik bilgi kaybi onlenir. GPTQ, buyuk dil modeli quantization alaninin diger onemli yontemidir ve ikinci derece Hessian matris optimizasyonu kullanir. AWQ ise daha sade bir olcekleme yaklasimiyla hesaplama maliyetini dusurup donanim dostu bir format uretir; bu nedenle cikarim hizi acisindan GPTQ'ya kiyasla avantaj saglar. Pratik uygulamada AutoAWQ kutuphanesi Hugging Face model deposunun herhangi bir modelini AWQ formatina donusturmek icin birkaç satirla Python kodu yeterlidir. vLLM ve TensorRT-LLM gibi populer cikarim cerceveleri AWQ formatini natively destekler. Bu ozellik, AWQ'yu ozellikle buyuk dil modellerini yerel sunucularda veya kenarda calistirmak isteyen organizasyonlar icin pratik bir tercih yapar. Apple Silicon, NVIDIA GPU'lar ve kucuk olcekli cikarim odakli donanim (Jetson gibi) uzerinde AWQ tutarli performans artisi saglar. INT4 nicileme, float32'ye kiyasla yaklasik dort kat daha az GPU bellek kullanir; bu da buyuk modelleri daha kucuk donanim konfigurasyon uzerinde calistirmayi mumkun kilar. **Sik Sorulan Sorular** **AWQ ile GPTQ arasindaki fark nedir?** GPTQ ikinci derece Hessian optimizasyonu kullanir; AWQ ise aktivasyon onem skoru temelli daha basit bir yaklasim izler. AWQ genellikle daha hizli cikarim saglarken GPTQ bazi benchmark'larda daha yuksek dogruluk sergileyebilir. **AWQ modelleri nerede bulunabilir?** Hugging Face Hub'da pek cok populer model icin AWQ formatli surumler mevcuttur; arama cubuguna modelin adi ve 'AWQ' yazarak bulunabilir. AutoAWQ kutuphanesiyle kendi modeli donusturme de mumkundur. **AWQ hangi model boyutlarinda en etkilidir?** 7B ile 70B parametre arasi modellerde INT4 AWQ en pratik dengeyi sunar. Daha kucuk modellerde kalite kaybi daha belirgin olabilir; cok buyuk modellerde ise bellek tasarrufunu acikca hissedilir. **vLLM ile AWQ modeller calistirilabilir mi?** Evet, vLLM AWQ formatini natively destekler ve yuksek verimliligi batch cikarimi ile AWQ modellerini verimli sekilde sunabilir.