Imọ Itọsọna

Awoṣe Quantization

Iwọn titobi awoṣe dinku nẹtiwọọki nkankikan nipa titoju awọn nọmba rẹ ni awọn iwọn diẹ, nitorinaa awoṣe kanna n ṣiṣẹ ni iyara ati lori ohun elo kekere.

2 min kakẹhin imudojuiwọn

Akopọ

It is the main reason large models can fit on a single GPU, a laptop, or even a phone.

Jin Dive

Awọn awoṣe ikẹkọ deede tọju iwuwo kọọkan bi nọmba 32-bit tabi 16-bit ti o lefofo loju omi. Quantization rọpo awọn ti o ni awọn ọna kika konge kekere bi awọn nọmba 8-bit (INT8) tabi awọn iye 4-bit (INT4), gige iranti ni aijọju 4x si 8x. Awoṣe paramita 70-biliọnu kan ti o nilo nipa 140GB ni 16-bit le ju silẹ nitosi 35GB ni 4-bit, ni ibamu lori GPU olumulo kan. Apeja naa jẹ deede: fun pọ ọpọlọpọ awọn iye sinu awọn garawa 256 tabi 16 padanu alaye. Awọn ọna ode oni bii GPTQ, AWQ, ati ọna kika NF4 ti a lo ninu QLoRA mu awọn ifosiwewe igbelowọn smart ati aabo awọn iwuwo ifura julọ, nitorinaa pipadanu didara nigbagbogbo jẹ kekere. Quantization jẹ idi ti awọn irinṣẹ bii llama.cpp ati Ollama le ṣiṣe awọn awoṣe ti o lagbara ni agbegbe laisi ile-iṣẹ data kan.

Imọ-imọ-ẹrọ

Iṣiro maapu maapu awọn iye gidi si akoj odidi kekere kan nipa lilo iwọn ati aaye-odo: store_int = yika(iye / iwọn) + zero_point. Yiyan iwọn daradara ni gbogbo ere. Ikanni-ikanni tabi igbelowọn ẹgbẹ-kọọkan tọju awọn iwọn lọtọ fun awọn ege matrix iwuwo kan, titoju pipe nibiti o ṣe pataki. Quantization ikẹkọ lẹhin-ikẹkọ kan ṣe iyipada awoṣe ti o pari, lakoko ti ikẹkọ ti o ni oye ṣe adaṣe yikaka lakoko ikẹkọ ki nẹtiwọọki kọ ẹkọ lati farada rẹ, nigbagbogbo fifun ni deede-bit kekere to dara julọ.

Ipa Ilana

Iye owo ati isuna

Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.

Awọn ipinnu diẹ sii

Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.

Iṣakoso didara

Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.

Ojo iwaju ti Quantization awoṣe

Reti deede-kekere nigbagbogbo lati di deede. Iwadi n titari 4-bit ti o ni igbẹkẹle, 2-bit, ati paapaa awọn iwuwo alakomeji, pẹlu awọn igbero pipe-konge ti o jẹ ki awọn fẹlẹfẹlẹ ifura ga. Hardware n tẹle: GPUs ati awọn eerun foonu ni bayi pẹlu INT8 abinibi, INT4, ati awọn ẹya math FP8. Awọn ọna kika bii FP8 ati MXFP4 ṣe ifọkansi lati darapo ibiti o ti lefofofo pẹlu iwọn awọn odidi. Ni idapọ pẹlu awọn imọ-ẹrọ bii QLoRA, titobi yoo jẹ ki awọn awoṣe iwọn-aala jẹ din owo lati ṣiṣẹ ati tunne daradara lori awọn ẹrọ ojoojumọ.

Real-World imuse

Nṣiṣẹ awoṣe 7B tabi 13B Llama lori kọǹpútà alágbèéká kan pẹlu llama.cpp tabi Ollama ni lilo awọn faili GGUF 4-bit.

Atunse itanran QLoRA awoṣe nla kan lori GPU kan nipa titọju awọn iwuwo mimọ ni didi ni 4-bit NF4.

Gbigbe awọn awoṣe INT8 sori awọn foonu pẹlu awọn akoko asiko ẹrọ ki awọn oluranlọwọ ṣiṣẹ offline ati ni ikọkọ.

Ṣiṣẹ awọn aaye ipari API ti o din owo nibiti iwọn INT8/FP8 ni aijọju ti ilọpo meji ati gige iye owo iranti.

Awọn ewu & Awọn ọna iṣọ

Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.

Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.

Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.

Ilana Ilana imuse

1

Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.

2

Aṣepari labẹ ẹru ojulowo ati awọn ipo data.

3

Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.

4

Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

Awọn iforukọsilẹ awoṣe

Awọn ibeere ti a beere nigbagbogbo

What is Model Quantization?

Iwọn titobi awoṣe dinku nẹtiwọọki nkankikan nipa titoju awọn nọmba rẹ ni awọn iwọn diẹ, nitorinaa awoṣe kanna n ṣiṣẹ ni iyara ati lori ohun elo kekere. O jẹ idi akọkọ ti awọn awoṣe nla le baamu lori GPU kan, kọǹpútà alágbèéká kan, tabi paapaa foonu kan.

Kini iwọn iwọn awoṣe nipataki yipada nipa nẹtiwọọki nkankikan?

Quantization tọju awọn paramita kanna ni awọn iwọn diẹ (fun apẹẹrẹ INT8 tabi INT4 dipo 16- tabi 32-bit floats), idinku iranti ati ṣiṣe iṣiro iyara.

Ni aijọju melo ni iranti le yi iyipada awoṣe lati 16-bit si 4-bit fipamọ?

Lilọ lati awọn iwọn 16 fun iwuwo kan si awọn iwọn 4 gige ibi ipamọ nipa iwọn kan ti mẹrin, eyiti o jẹ idi ti awọn awoṣe nla le baamu lori GPU kan.

Kí ni akọkọ downside ti ibinu kekere-bit quantization?

Yiya aworan awọn iye lọpọlọpọ si awọn ipele ọtọtọ diẹ padanu alaye, eyiti o le dinku didara ayafi ti igbelowọn ọlọgbọn ṣe aabo awọn iwuwo ifura.

Báwo ni ìdánilẹ́kọ̀ọ́ tí a mọ̀ nípa dídán mọ́ ṣe yàtọ̀ sí dídidiwọ̀n ìdánilẹ́kọ̀ọ́ lẹ́yìn-ọ̀-rẹyìn?

Idanileko ti o mọ ni iwọn ṣe agbero aṣiṣe yika sinu lupu ikẹkọ, nitorinaa nẹtiwọọki ṣe deede ati nigbagbogbo tọju deede diẹ sii ni awọn iwọn kekere kekere.

Ilana wo lo nlo titobi 4-bit lati ṣe atunṣe awọn awoṣe nla ti o dara ni ifarada lori GPU kan?

QLoRA ṣe itọju awoṣe ipilẹ ni aotoju ni ọna kika 4-bit NF4 ati ṣe ikẹkọ awọn iwọn ohun ti nmu badọgba kekere, jẹ ki awọn awoṣe nla jẹ aifwy daradara lori ohun elo iwọntunwọnsi.