FP8 ati Kekere-konge Awọn ọna kika
FP8 jẹ ọna kika nọmba oju omi lilefoofo 8-bit ti o jẹ ki awọn awoṣe AI tọju awọn iwuwo ati ṣiṣe iṣiro nipa lilo idamẹrin ti iranti awọn nọmba 32-bit boṣewa.
Akopọ
It is a key trick for making giant models cheaper and faster to train and serve.
Jin Dive
Awọn nẹtiwọọki nkankikan jẹ ti awọn ọkẹ àìmọye awọn nọmba. Ni aṣa awọn nọmba wọnyẹn lo 32 bit (FP32) tabi 16 die-die (FP16/BF16) ọkọọkan. FP8 dinku wọn si awọn iwọn 8 nikan, gige iranti ati bandiwidi ni aijọju ni idaji dipo 16-bit. Awọn ipalemo FP8 ti o wọpọ meji lo wa: E4M3 (awọn iwọn olutayo mẹrin, awọn iwọn mantissa 3) yoo fun ni konge diẹ sii ṣugbọn iwọn ti o kere ju, ati E5M2 (olupilẹṣẹ 5, 2 mantissa) n funni ni iwọn ti o gbooro ṣugbọn awọn igbesẹ ti o kere ju. Iṣowo-pipa jẹ iṣootọ: awọn iwọn diẹ tumọ si awọn aṣiṣe iyipo. Lati duro deede, awọn ilana lo fun-tensor tabi awọn ifosiwewe idinaki ti o ṣe iwọn awọn iye sinu iwọn lilo FP8. NVIDIA's Hopper ati Blackwell GPUs ṣafikun awọn ẹrọ matrix FP8 hardware, ti o jẹ ki o wulo fun ikẹkọ mejeeji ati itọkasi. Awọn ọna kika tuntun bii MXFP8, MXFP4, ati NVFP4 Titari paapaa ni isalẹ pẹlu awọn bulọọki iwọn-miki ti o pin.
Imọ-imọ-ẹrọ
Ipenija FP8 jẹ iwọn ti o ni agbara. Pẹlu iwonba diẹ ti awọn ege olutayo, awọn iṣẹ ṣiṣe nla tabi kekere ti nṣan tabi ṣiṣan si odo. Atunṣe naa jẹ wiwọn: isodipupo tensor nipasẹ ifosiwewe kan ki awọn iye rẹ ba de ni ferese aṣoju ti FP8, ṣe FP8 isodipupo-akojọpọ, lẹhinna pin sẹhin, nigbagbogbo ikojọpọ awọn akopọ apa kan ni konge giga (FP16/FP32). E4M3 ni igbagbogbo lo fun awọn iwuwo ati awọn iṣẹ ṣiṣe, E5M2 fun awọn gradients nibiti ibiti o ti ṣe pataki ju konge lọ.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ọjọ iwaju ti FP8 ati Awọn ọna kika Ipeye-Kekere
Konge ti wa ni ije sisale. Lẹhin ti FP8 wa awọn ọna kika micro-scaling 4-bit (MXFP4, NVFP4) ti o ṣe iwọn iwọn pinpin kekere fun bulọọki kekere, ati ohun elo Blackwell ni bayi n yara FP4 taara. Reti awọn ilana ti o dapọ-konge nibiti awọn ipele oriṣiriṣi lo oriṣiriṣi awọn iwọn-bit, pẹlu ikẹkọ iwọn-iye to dara julọ ki 4-bit di aiyipada fun itọkasi. Ipari ipari naa n fa awọn awoṣe iwọn-aala si diẹ, awọn eerun ti o din owo laisi pipadanu didara iwọnwọn.
Real-World imuse
Ikẹkọ awọn awoṣe ede nla lori NVIDIA Hopper/Blackwell GPUs ni lilo FP8 lati ni aijọju ilọpo meji ni ilodi si BF16
Ṣiṣẹda itọkasi chatbot ni FP8 nitorinaa awoṣe kan baamu lori awọn GPU diẹ ati dahun awọn ibeere diẹ sii fun iṣẹju-aaya
Lilo E5M2 fun ibaraẹnisọrọ gradient lakoko ikẹkọ pinpin lati ge bandiwidi nẹtiwọọki laarin awọn apa
Gbigbe awọn awoṣe titobi MXFP4/NVFP4 lati baamu awoṣe iwọn-aala kan lori GPU iranti giga kan fun itọkasi din owo
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Awọn ọna kika Serialization awoṣe
Awọn ibeere ti a beere nigbagbogbo
What is FP8 and Low-Precision Formats?
FP8 jẹ ọna kika nọmba oju omi lilefoofo 8-bit ti o jẹ ki awọn awoṣe AI tọju awọn iwuwo ati ṣiṣe iṣiro nipa lilo idamẹrin ti iranti awọn nọmba 32-bit boṣewa. O jẹ ẹtan bọtini fun ṣiṣe awọn awoṣe omiran din owo ati yiyara lati ṣe ikẹkọ ati ṣiṣẹ.
Awọn die-die melo ni nọmba FP8 nlo ni akawe si nọmba FP32 boṣewa kan?
FP8 nlo 8 die-die nigba ti FP32 nlo 32 die-die, nitorina FP8 gba idamẹrin ti ibi ipamọ ati bandiwidi.
Kini awọn aami 'E4M3' ati 'E5M2' ṣe apejuwe nipa ọna kika FP8 kan?
E4M3 tumo si 4 olutayo die-die ati 3 mantissa die-die; E5M2 tumo si 5 olutayo ati 2 mantissa die-die. Awọn ege olupilẹṣẹ diẹ sii gbooro iwọn; diẹ mantissa die-die fi konge.
Kini idi ti awọn opo gigun ti FP8 lo awọn ifosiwewe igbelosoke si awọn tenors?
Pẹlu awọn ege olupilẹṣẹ diẹ, awọn iye nla nṣàn ati awọn ti o kere ju ti nṣàn si odo. Iwontunwọnsi ṣe atunṣe awọn tenors sinu ferese ohun elo FP8 ṣaaju ki iṣiro naa.
Iṣowo-pipa wo ni isalẹ akọkọ ti lilo FP8?
Awọn die-die ti o kere julọ tumọ si aṣoju irẹwẹsi ati aṣiṣe iyipo diẹ sii. Anfaani naa kere pupọ si iranti ati bandiwidi, ati iyara iyara lori ohun elo atilẹyin.
Eyi ti iran NVIDIA GPU akọkọ ṣafikun atilẹyin ohun elo igbẹhin fun matrix matrix FP8?
Awọn GPU ti o da lori Hopper bii H100 ṣe afihan atilẹyin FP8 Tensor Core, ati Blackwell nigbamii fa eyi si FP4.