Ntụziaka nka

GPTQ na AWQ Ngụkọta Ọzụzụ gasịchara

GPTQ na AWQ bụ ụzọ abụọ na-eduga maka ibelata ụdị asụsụ a zụrụ azụ na nkenke 4-bit ka ha na-agba ọsọ na ngwaike dị ọnụ ala karịa.

2 nkeji na-agụEmelitere ikpeazụ

Nchịkọta

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Ime miri emi

Quantization nke ọzụzụ ọzụzụ (PTQ) na-akpakọ ụdị emechara na-azụghachighị ya, na-esepụta oke dị elu ruo 4 ibe n'ibe ruo ihe dị ka nkeji iri na ise nke ebe nchekwa. Ihe ịma aka bụ ime nke a n'emebighị ihe ziri ezi. GPTQ (nkwacha nke OBQ) na-atụle oyi akwa site na oyi akwa, na-eji ozi usoro nke abụọ sitere na obere nhazi dataset iji mezie nha ndị fọdụrụ wee kwụọ ụgwọ maka njehie okirikiri ọ bụla. AWQ (Activation-aware Weight Quantization) na-ewe akụkụ dị iche iche: ọ na-achọpụta na obere akụkụ nke ọwa ibu dị mkpa na-enweghị atụ, nke a na-achọpụta site n'ile anya n'ogo mmalite, ma na-echebe ọwa ndị ahụ dị egwu site n'ịtụgharị karịa ịkọpụta ha n'ike. Ha abụọ kwere ka ụdị dị ka Llama na-agba ọsọ na 4-bit, na ngwaọrụ ndị dị ka vLLM, llama.cpp, na AutoGPTQ emeela ka ha bụrụ isi maka ntinye aka na mpaghara na ọnụ ahịa.

Nghọta nka nka

GPTQ na-eji ihe dị ka Hessian (curvature of the loss) na-ekpebi ka ịgbakọ otu ịdị arọ ga-esi kụda ndị ọzọ, na-ebelata njehie ewepụtara. AWQ na-amapụ ndị Hessia kpam kpam: ọ na-agbakọ ihe na-eme ka ọwa ọ bụla wee na-eme ka ọwa ịdị arọ dị mkpa na-edobe nke ọma nke ọma, wee tụọ ọnụ n'otu n'otu. Ha abụọ na-edobe mmemme n'ụzọ ziri ezi ma na-akpakọba ihe dị arọ, ebe ọ bụ na ịdị arọ na-achịkwa ebe nchekwa ebe ịgbalite quantization na-emerụ ahụ nke ọma karịa.

Mmetụta atụmatụ

Ọnụ ego na mmefu ego

Mkpebi ihe owuwu ụlọ na-akwalite arụmọrụ yana ọnụ ahịa ọrụ ruo ọtụtụ afọ.

Mkpebi doro anya

Nkà mmụta nka na-enyere ndị otu egwuregwu aka ịhọrọ nchịkọta ziri ezi, ọ bụghị naanị nke kachasị ọhụrụ.

Quality akara

Nhọrọ injinia ka mma na-ebelata ihe omume ntụkwasị obi na mmepụta.

Ọdịnihu nke GPTQ na AWQ Post-Training Quantization

Quantization na-agbada n'okpuru 4 bits gaa na atụmatụ 3-bit, 2-bit na ngwakọta nke ọma, na-ejikọta ya na sparsity. Na-atụ anya njikọ dị nso na injin ndị na-eje ozi ka ọnụ ọgụgụ, mkpakọ KV-cache, na ngbanwe nke ịkọ nkọ ga-arụkọ ọrụ ọnụ. Nkwado ngwaike maka ụdị obere bit dị ka NVFP4 na MXFP4 na-eto eto, na ngwaọrụ akpaaka ga-ebuwanye ibu n'obosara nke ọ bụla. Ebumnuche sara mbara dị nso 4-bit (ma dị ala) dị ka ndabara, na-eme ka ụdị siri ike dị ọnụ ala iji jee ozi ebe niile.

Mmejuputa n'ezie n'ụwa

Na-agba ọsọ ụdị Llama nha ijeri 70 na otu GPU ndị ahịa 24 GB na-eji 4-bit GPTQ arọ.

Ụdị agbakọrọ ọnụ AWQ jere ozi na ntinye dị elu na vLLM maka mmepụta API nke na-arụ ọrụ nke ọma.

llama.cpp na-eji ihe ọ̀tụ̀tụ̀ GGUF atụnyere iji mee ụdị asụsụ na mpaghara na laptọọpụ CPU.

Ịmak Face's AutoGPTQ na AutoAWQ ọba akwụkwọ na-ahapụ ndị mmepe tụọ ụdị ebudatara n'ahịrị koodu ole na ole.

Ihe ize ndụ & okporo ụzọ nche

Ịkwalite otu akara ngosi nwere ike zoo adịghị ike sistemụ sara mbara.

A na-eledakarị ihe akụrụngwa na ụgwọ ọrụ anya.

Ọdịiche nchekwa na nleba anya nwere ike itolite ka sistemu na-adịwanye mgbagwoju anya.

Map mmejuputa

1

Kọwaa latency, ịdịmma na ebumnuche ọnụ ahịa tupu mmejuputa ya.

2

Benchmark n'okpuru ibu dị adị na ọnọdụ data.

3

Nleba anya akụrụngwa maka mperi, ịkpafu na mmetụta onye ọrụ.

4

Kwadebe ụzọ nzaghachi azụghachi azụ na ihe omume tupu ịchachaa.

Nọgide na-eme nchọpụta

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Malite ajụjụ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ntuziaka na-esote

Mmetụta Ọrụ maka Ngosipụta Data Ọzụzụ

Ajụjụ a na-ajụkarị

What is GPTQ and AWQ Post-Training Quantization?

GPTQ na AWQ bụ ụzọ abụọ na-eduga maka ibelata ụdị asụsụ a zụrụ azụ na nkenke 4-bit ka ha na-agba ọsọ na ngwaike dị ọnụ ala karịa. Ha bụ ya mere ị ga-eji nwee ike ịgba ọsọ ihe nlereanya na otu GPU ndị na-azụ ahịa kama ịkwado datacenter.

Kedu ihe 'Quantization' mgbe ọzụzụ gasịrị' pụtara?

Ngụkọta ọzụzụ ọzụzụ gachara na-ebelata izi ezi nke ịdị arọ ụdị emechara (dịka ọmụmaatụ, ruo 4 bits) na-azụghachighị ya site na ọkọ.

Kedu ozi GPTQ na-eji akwụ ụgwọ maka mmejọ ịgbagharị mgbe ị na-agụta ọnụ ọgụgụ?

GPTQ na-eji Hessian dị ihe dị ka ịghọta ka ịkọwapụta otu ịdị arọ si emetụta mfu ahụ, wee mezie nha ndị fọdụrụ iji kwụọ ụgwọ.

Kedu isi ihe nghota na-akpali AWQ (Activation-aware Weight Quantization)?

AWQ na-achọpụta ọwa ịdị arọ dị arọ site na iji ogo mmalite ma na-echekwa ha site na nchacha, ebe ọwa ole na ole na-enwe ihe na-ezighi ezi.

Ihe dị ka ebe nchekwa ole ka ọnụọgụ 4-bit na-echekwa na ịdị arọ 16-bit?

Ịga site na 16 bits ruo 4 bits kwa arọ na-ebelata ebe nchekwa ịdị arọ ruo ihe dị ka otu ụzọ n'ụzọ anọ, dị ka mbelata 4x.

Kedu ihe kpatara ma GPTQ na AWQ na-ejikarị ọnụ ọgụgụ dị arọ mana na-eme ka ọrụ rụọ ọrụ na nkenke dị elu?

Arọ bụ isi ihe na-eri ebe nchekwa, ebe activations na-enwe mmetụta nke ọma na mfu nke ziri ezi, ya mere ọnụọgụ naanị ibu bụ ebe ụtọ a na-ahụkarị.