GPTQ ak AWQ ginaaw tàggat
GPTQ ak AWQ ñaari pexe yu gëna am solo lañu ngir wàññi modeli làkk yiñ tàggat ba noppi ñu am 4-bit ci njub, suko defee ñu mëna dox ci hardware bu gëna ndaw te yomb njëg.
Résumé
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
Plongeur bu xóot
Quantisation post-training (PTQ) dafay kompresse model bi jeex te duñu ko tàggataat, di karte poid yu am précision bu yéeg ba 4 bits ngir xaaj mémoire bi. Jafe-jafe bi mooy def lii te doo yàq njubte gi. GPTQ (muy setal OBQ) dafay xayma poid yi couche par couche, di jëfandikoo ay leeral ci ñaareelu rang ci benn done bu ndaw ngir méngale poid yi des ak ngir kompensaasioŋ njuumte bu nekk ci rounding. AWQ (Activation-aware Weight Quantization) jël na beneen wàll: dafay seetlu ni paccum chaine yu ndaw yi dañu am solo lool, ñu xamme ko ci xool magnitudes activation, ba noppi aar chaine yu am solo yooyu ci scaling moo gën leen quantize aggressivement. Ñoom ñaar ñépp ñu ngi may model yu melni Llama ñu dox ci 4-bit, jumtukaay yu melni vLLM, llama.cpp, ak AutoGPTQ def leen ñu gëna am solo ci wàllu dëkk ak njëg yu baax.
Gis-gis xarala
GPTQ dafay jëfandikoo ap xayma bu Hessian (courbure bu perte bi) ngir xam naka la benn poid bi wara nudge ñeneen ñi, di wàññi njuumte biñ dugal. AWQ dafay sànni Hessians yépp: dafay xayma facteur de scaling ci chaine bu nekk suko defee chaine yu am solo yi mëna wéy di gëna jub, ba noppi di quantize ci anam wu wuute. Ñoom ñaar ñépp dañuy tëye aktivaasioŋ yi ci gëna dëggu te dañuy kompresse poid yi kese, ndax poid yi ñooy ëpp doole ci mémoire bi ci jamono ji aktivaasioŋ quantisation dafay gëna gaañ njub.
njeextalu pexe
Njëgg ak budget
Dogal yi architecture di jël dañuy indi njariñ ak njëgu liggéey bi ay at ci ginaaw.
dogal yu gëna leer
Njàngalem xarala yi dafay jàppale ekip yi ñu tànn li gën, te baña yam ci li gëna bees daal.
Xool kalite
Tanneef yu gëna baax ci wàllu ingeñër dina wàññi jafe-jafe yi ci wàllu wóor ci liggéey bi.
Ëlëgu GPTQ ak AWQ ginaaw tàggat
Kantite dafay puus ci suufu 4 bit ci 3-bit, 2-bit, ak xeetu njubte bu jaxaso, di faral di boole ak sparsity. Xaarandi lëkkaloo bu gëna jege ak motër yiy liggéey suko defee kantite, kompresioŋ KV-cache, ak dekodaas speculatif bokk liggéey. Jàppale hardware ngir formaa yu ndaw yu melni NVFP4 ak MXFP4 mingi màgg, te jumtukaayi otomatik dina ñu gëna tànn yaatuwaayu bit bu nekk. Mébet bu mag bi mooy 4-bit (ak lu gëna ndaw) bu amul benn perte, moo tax model yu dëgër yi yomb ngir liggéey fépp.
Doxal ci àdduna dëgg
Doxal benn xeetu Llama bu am 70 milyaar ci benn GPU bu 24 GB di jëfandikoo 4-bit GPTQ.
Modèle yiñ xayma ci AWQ dañu am produit bu bari ci vLLM ngir API yu am njariñ.
llama.cpp di jëfandikoo poids GGUF yuñ xayma ngir doxal modeli làkk yi ci CPU ordinatër portable.
Bibliothèque AutoGPTQ ak AutoAWQ yu Hugging Face dañuy may developpeur yi ñu xayma limu model biñ yebbi ci ay ligne kode yu néew.
Risk yi ak balustrade yi
Optimize benn benchmark mën na nëbb ñakk kattan yu gëna yaatu ci sistem bi.
Njëg li ñuy fay ci infrastructure yi ak ci toppatoo dañuy faral di suufeel.
Bu sistem yi di gëna xawa jafee xam, jafe-jafe yi am ci wàllu kaaraange ak seetlu mën nañu gëna bari.
Roadmap ngir samp gi
Mandargal latency, kalite, ak njëg yi laata ngay jëfandikoo.
Benchmark ci biir sargal ak done yu dëggu.
Jumtukaay bi di saytu njuumte yi, derive bi ak njeextalu jëfandikukat bi.
Waajal rollback ak yooni tontu ci jafe-jafe yi laata ngay eskale.
Weyal di banneexu
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Gis bi ci topp
Fonction yu am njeexital ngir joxe done ci tàggat yaram
Laaj yi ñuy faral di laaj
What is GPTQ and AWQ Post-Training Quantization?
GPTQ ak AWQ ñaari pexe yu gëna am solo lañu ngir wàññi modeli làkk yiñ tàggat ba noppi ñu am 4-bit ci njub, suko defee ñu mëna dox ci hardware bu gëna ndaw te yomb njëg. Moo tax nga mëna doxal model bu mëna liggéey ci benn GPU konsomatër ci barabu rack datacenter.
Luy 'kantisation ginaaw tàggat yaram'?
Quantisation ginaaw tàggat yaram dafay wàññi njubte gi ci diisaayu model bi jeex (lu melni, ba 4 bit) te doo tàggataat ko ci noonu rek.
Ban leeral la GPTQ di jëfandikoo ngir dindi njuumti yi ci wàllu wërsëg suñuy xayma?
GPTQ dafay jëfandikoo ab Hessian bu jege ngir xam naka la benn poid di amee ci perte bi, ba noppi mu defar poid yi des ngir kompensaasioŋ.
Lan mooy gis-gis bi gëna am solo biy dawal AWQ (Kantasioŋ diisaay biy xam-xam)?
AWQ dafay xàmmee chaine de poids salient ci jëfandikoo magnitudes de activation ba noppi aar leen ci scaling, ndax chaine yu néew dañu am solo lool.
Lu tollu ci ñaata mémoire la quantisation 4-bit di sakkanal ak poids 16-bit yi?
Dema demee ci 16 bits dem ci 4 bits ci poids bu nekk dafay wàññi mémoire poids ci lu tollu ci benn ci ñatti pàcc yi, lu tollu ci 4x wàññiku.
Lan moo waral GPTQ ak AWQ ñoom ñaar ñuy xayma diisaay yi waaye ñuy tëye aktivaasioŋ yi ci gëna dëggu?
Poid yi ñooy njëgu mémoire bi gëna mag, waaye activation yi ñoo gëna sensible ci ñàkka am precision, kon quantisation poid bi kese mooy barab bi gëna neex.