GPTQ na AWQ Ngụkọta Ọzụzụ gasịchara
GPTQ na AWQ bụ ụzọ abụọ na-eduga maka ibelata ụdị asụsụ a zụrụ azụ na nkenke 4-bit ka ha na-agba ọsọ na ngwaike dị ọnụ ala karịa.
Nchịkọta
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
Ime miri emi
Quantization nke ọzụzụ ọzụzụ (PTQ) na-akpakọ ụdị emechara na-azụghachighị ya, na-esepụta oke dị elu ruo 4 ibe n'ibe ruo ihe dị ka nkeji iri na ise nke ebe nchekwa. Ihe ịma aka bụ ime nke a n'emebighị ihe ziri ezi. GPTQ (nkwacha nke OBQ) na-atụle oyi akwa site na oyi akwa, na-eji ozi usoro nke abụọ sitere na obere nhazi dataset iji mezie nha ndị fọdụrụ wee kwụọ ụgwọ maka njehie okirikiri ọ bụla. AWQ (Activation-aware Weight Quantization) na-ewe akụkụ dị iche iche: ọ na-achọpụta na obere akụkụ nke ọwa ibu dị mkpa na-enweghị atụ, nke a na-achọpụta site n'ile anya n'ogo mmalite, ma na-echebe ọwa ndị ahụ dị egwu site n'ịtụgharị karịa ịkọpụta ha n'ike. Ha abụọ kwere ka ụdị dị ka Llama na-agba ọsọ na 4-bit, na ngwaọrụ ndị dị ka vLLM, llama.cpp, na AutoGPTQ emeela ka ha bụrụ isi maka ntinye aka na mpaghara na ọnụ ahịa.
Nghọta nka nka
GPTQ na-eji ihe dị ka Hessian (curvature of the loss) na-ekpebi ka ịgbakọ otu ịdị arọ ga-esi kụda ndị ọzọ, na-ebelata njehie ewepụtara. AWQ na-amapụ ndị Hessia kpam kpam: ọ na-agbakọ ihe na-eme ka ọwa ọ bụla wee na-eme ka ọwa ịdị arọ dị mkpa na-edobe nke ọma nke ọma, wee tụọ ọnụ n'otu n'otu. Ha abụọ na-edobe mmemme n'ụzọ ziri ezi ma na-akpakọba ihe dị arọ, ebe ọ bụ na ịdị arọ na-achịkwa ebe nchekwa ebe ịgbalite quantization na-emerụ ahụ nke ọma karịa.
Mmetụta atụmatụ
Ọnụ ego na mmefu ego
Mkpebi ihe owuwu ụlọ na-akwalite arụmọrụ yana ọnụ ahịa ọrụ ruo ọtụtụ afọ.
Mkpebi doro anya
Nkà mmụta nka na-enyere ndị otu egwuregwu aka ịhọrọ nchịkọta ziri ezi, ọ bụghị naanị nke kachasị ọhụrụ.
Quality akara
Nhọrọ injinia ka mma na-ebelata ihe omume ntụkwasị obi na mmepụta.
Ọdịnihu nke GPTQ na AWQ Post-Training Quantization
Quantization na-agbada n'okpuru 4 bits gaa na atụmatụ 3-bit, 2-bit na ngwakọta nke ọma, na-ejikọta ya na sparsity. Na-atụ anya njikọ dị nso na injin ndị na-eje ozi ka ọnụ ọgụgụ, mkpakọ KV-cache, na ngbanwe nke ịkọ nkọ ga-arụkọ ọrụ ọnụ. Nkwado ngwaike maka ụdị obere bit dị ka NVFP4 na MXFP4 na-eto eto, na ngwaọrụ akpaaka ga-ebuwanye ibu n'obosara nke ọ bụla. Ebumnuche sara mbara dị nso 4-bit (ma dị ala) dị ka ndabara, na-eme ka ụdị siri ike dị ọnụ ala iji jee ozi ebe niile.
Mmejuputa n'ezie n'ụwa
Na-agba ọsọ ụdị Llama nha ijeri 70 na otu GPU ndị ahịa 24 GB na-eji 4-bit GPTQ arọ.
Ụdị agbakọrọ ọnụ AWQ jere ozi na ntinye dị elu na vLLM maka mmepụta API nke na-arụ ọrụ nke ọma.
llama.cpp na-eji ihe ọ̀tụ̀tụ̀ GGUF atụnyere iji mee ụdị asụsụ na mpaghara na laptọọpụ CPU.
Ịmak Face's AutoGPTQ na AutoAWQ ọba akwụkwọ na-ahapụ ndị mmepe tụọ ụdị ebudatara n'ahịrị koodu ole na ole.
Ihe ize ndụ & okporo ụzọ nche
Ịkwalite otu akara ngosi nwere ike zoo adịghị ike sistemụ sara mbara.
A na-eledakarị ihe akụrụngwa na ụgwọ ọrụ anya.
Ọdịiche nchekwa na nleba anya nwere ike itolite ka sistemu na-adịwanye mgbagwoju anya.
Map mmejuputa
Kọwaa latency, ịdịmma na ebumnuche ọnụ ahịa tupu mmejuputa ya.
Benchmark n'okpuru ibu dị adị na ọnọdụ data.
Nleba anya akụrụngwa maka mperi, ịkpafu na mmetụta onye ọrụ.
Kwadebe ụzọ nzaghachi azụghachi azụ na ihe omume tupu ịchachaa.
Nọgide na-eme nchọpụta
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Ntuziaka na-esote
Mmetụta Ọrụ maka Ngosipụta Data Ọzụzụ
Ajụjụ a na-ajụkarị
What is GPTQ and AWQ Post-Training Quantization?
GPTQ na AWQ bụ ụzọ abụọ na-eduga maka ibelata ụdị asụsụ a zụrụ azụ na nkenke 4-bit ka ha na-agba ọsọ na ngwaike dị ọnụ ala karịa. Ha bụ ya mere ị ga-eji nwee ike ịgba ọsọ ihe nlereanya na otu GPU ndị na-azụ ahịa kama ịkwado datacenter.
Kedu ihe 'Quantization' mgbe ọzụzụ gasịrị' pụtara?
Ngụkọta ọzụzụ ọzụzụ gachara na-ebelata izi ezi nke ịdị arọ ụdị emechara (dịka ọmụmaatụ, ruo 4 bits) na-azụghachighị ya site na ọkọ.
Kedu ozi GPTQ na-eji akwụ ụgwọ maka mmejọ ịgbagharị mgbe ị na-agụta ọnụ ọgụgụ?
GPTQ na-eji Hessian dị ihe dị ka ịghọta ka ịkọwapụta otu ịdị arọ si emetụta mfu ahụ, wee mezie nha ndị fọdụrụ iji kwụọ ụgwọ.
Kedu isi ihe nghota na-akpali AWQ (Activation-aware Weight Quantization)?
AWQ na-achọpụta ọwa ịdị arọ dị arọ site na iji ogo mmalite ma na-echekwa ha site na nchacha, ebe ọwa ole na ole na-enwe ihe na-ezighi ezi.
Ihe dị ka ebe nchekwa ole ka ọnụọgụ 4-bit na-echekwa na ịdị arọ 16-bit?
Ịga site na 16 bits ruo 4 bits kwa arọ na-ebelata ebe nchekwa ịdị arọ ruo ihe dị ka otu ụzọ n'ụzọ anọ, dị ka mbelata 4x.
Kedu ihe kpatara ma GPTQ na AWQ na-ejikarị ọnụ ọgụgụ dị arọ mana na-eme ka ọrụ rụọ ọrụ na nkenke dị elu?
Arọ bụ isi ihe na-eri ebe nchekwa, ebe activations na-enwe mmetụta nke ọma na mfu nke ziri ezi, ya mere ọnụọgụ naanị ibu bụ ebe ụtọ a na-ahụkarị.