Awoṣe Quantization
Iwọn titobi awoṣe dinku nẹtiwọọki nkankikan nipa titoju awọn nọmba rẹ ni awọn iwọn diẹ, nitorinaa awoṣe kanna n ṣiṣẹ ni iyara ati lori ohun elo kekere.
Akopọ
It is the main reason large models can fit on a single GPU, a laptop, or even a phone.
Jin Dive
Awọn awoṣe ikẹkọ deede tọju iwuwo kọọkan bi nọmba 32-bit tabi 16-bit ti o lefofo loju omi. Quantization rọpo awọn ti o ni awọn ọna kika konge kekere bi awọn nọmba 8-bit (INT8) tabi awọn iye 4-bit (INT4), gige iranti ni aijọju 4x si 8x. Awoṣe paramita 70-biliọnu kan ti o nilo nipa 140GB ni 16-bit le ju silẹ nitosi 35GB ni 4-bit, ni ibamu lori GPU olumulo kan. Apeja naa jẹ deede: fun pọ ọpọlọpọ awọn iye sinu awọn garawa 256 tabi 16 padanu alaye. Awọn ọna ode oni bii GPTQ, AWQ, ati ọna kika NF4 ti a lo ninu QLoRA mu awọn ifosiwewe igbelowọn smart ati aabo awọn iwuwo ifura julọ, nitorinaa pipadanu didara nigbagbogbo jẹ kekere. Quantization jẹ idi ti awọn irinṣẹ bii llama.cpp ati Ollama le ṣiṣe awọn awoṣe ti o lagbara ni agbegbe laisi ile-iṣẹ data kan.
Imọ-imọ-ẹrọ
Iṣiro maapu maapu awọn iye gidi si akoj odidi kekere kan nipa lilo iwọn ati aaye-odo: store_int = yika(iye / iwọn) + zero_point. Yiyan iwọn daradara ni gbogbo ere. Ikanni-ikanni tabi igbelowọn ẹgbẹ-kọọkan tọju awọn iwọn lọtọ fun awọn ege matrix iwuwo kan, titoju pipe nibiti o ṣe pataki. Quantization ikẹkọ lẹhin-ikẹkọ kan ṣe iyipada awoṣe ti o pari, lakoko ti ikẹkọ ti o ni oye ṣe adaṣe yikaka lakoko ikẹkọ ki nẹtiwọọki kọ ẹkọ lati farada rẹ, nigbagbogbo fifun ni deede-bit kekere to dara julọ.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Quantization awoṣe
Reti deede-kekere nigbagbogbo lati di deede. Iwadi n titari 4-bit ti o ni igbẹkẹle, 2-bit, ati paapaa awọn iwuwo alakomeji, pẹlu awọn igbero pipe-konge ti o jẹ ki awọn fẹlẹfẹlẹ ifura ga. Hardware n tẹle: GPUs ati awọn eerun foonu ni bayi pẹlu INT8 abinibi, INT4, ati awọn ẹya math FP8. Awọn ọna kika bii FP8 ati MXFP4 ṣe ifọkansi lati darapo ibiti o ti lefofofo pẹlu iwọn awọn odidi. Ni idapọ pẹlu awọn imọ-ẹrọ bii QLoRA, titobi yoo jẹ ki awọn awoṣe iwọn-aala jẹ din owo lati ṣiṣẹ ati tunne daradara lori awọn ẹrọ ojoojumọ.
Real-World imuse
Nṣiṣẹ awoṣe 7B tabi 13B Llama lori kọǹpútà alágbèéká kan pẹlu llama.cpp tabi Ollama ni lilo awọn faili GGUF 4-bit.
Atunse itanran QLoRA awoṣe nla kan lori GPU kan nipa titọju awọn iwuwo mimọ ni didi ni 4-bit NF4.
Gbigbe awọn awoṣe INT8 sori awọn foonu pẹlu awọn akoko asiko ẹrọ ki awọn oluranlọwọ ṣiṣẹ offline ati ni ikọkọ.
Ṣiṣẹ awọn aaye ipari API ti o din owo nibiti iwọn INT8/FP8 ni aijọju ti ilọpo meji ati gige iye owo iranti.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Awọn iforukọsilẹ awoṣe
Awọn ibeere ti a beere nigbagbogbo
What is Model Quantization?
Iwọn titobi awoṣe dinku nẹtiwọọki nkankikan nipa titoju awọn nọmba rẹ ni awọn iwọn diẹ, nitorinaa awoṣe kanna n ṣiṣẹ ni iyara ati lori ohun elo kekere. O jẹ idi akọkọ ti awọn awoṣe nla le baamu lori GPU kan, kọǹpútà alágbèéká kan, tabi paapaa foonu kan.
Kini iwọn iwọn awoṣe nipataki yipada nipa nẹtiwọọki nkankikan?
Quantization tọju awọn paramita kanna ni awọn iwọn diẹ (fun apẹẹrẹ INT8 tabi INT4 dipo 16- tabi 32-bit floats), idinku iranti ati ṣiṣe iṣiro iyara.
Ni aijọju melo ni iranti le yi iyipada awoṣe lati 16-bit si 4-bit fipamọ?
Lilọ lati awọn iwọn 16 fun iwuwo kan si awọn iwọn 4 gige ibi ipamọ nipa iwọn kan ti mẹrin, eyiti o jẹ idi ti awọn awoṣe nla le baamu lori GPU kan.
Kí ni akọkọ downside ti ibinu kekere-bit quantization?
Yiya aworan awọn iye lọpọlọpọ si awọn ipele ọtọtọ diẹ padanu alaye, eyiti o le dinku didara ayafi ti igbelowọn ọlọgbọn ṣe aabo awọn iwuwo ifura.
Báwo ni ìdánilẹ́kọ̀ọ́ tí a mọ̀ nípa dídán mọ́ ṣe yàtọ̀ sí dídidiwọ̀n ìdánilẹ́kọ̀ọ́ lẹ́yìn-ọ̀-rẹyìn?
Idanileko ti o mọ ni iwọn ṣe agbero aṣiṣe yika sinu lupu ikẹkọ, nitorinaa nẹtiwọọki ṣe deede ati nigbagbogbo tọju deede diẹ sii ni awọn iwọn kekere kekere.
Ilana wo lo nlo titobi 4-bit lati ṣe atunṣe awọn awoṣe nla ti o dara ni ifarada lori GPU kan?
QLoRA ṣe itọju awoṣe ipilẹ ni aotoju ni ọna kika 4-bit NF4 ati ṣe ikẹkọ awọn iwọn ohun ti nmu badọgba kekere, jẹ ki awọn awoṣe nla jẹ aifwy daradara lori ohun elo iwọntunwọnsi.