Technický PRŮVODCE

FP8 a formáty s nízkou přesností

FP8 je 8bitový formát čísel s plovoucí desetinnou čárkou, který umožňuje modelům AI ukládat váhy a spouštět matematiku s využitím čtvrtiny paměti standardních 32bitových čísel.

2 minuty čteníNaposledy aktualizováno

Přehled

It is a key trick for making giant models cheaper and faster to train and serve.

Hluboký ponor

Neuronové sítě se skládají z miliard čísel. Tradičně tato čísla používala každé 32 bitů (FP32) nebo 16 bitů (FP16/BF16). FP8 je zmenší na pouhých 8 bitů, čímž sníží paměť a šířku pásma zhruba na polovinu oproti 16bitům. Existují dvě běžná rozložení FP8: E4M3 (4 exponentní bity, 3 mantisové bity) poskytuje větší přesnost, ale menší rozsah a E5M2 (5 exponentů, 2 mantisy) poskytuje širší rozsah, ale hrubší kroky. Kompromisem je věrnost: méně bitů znamená zaokrouhlovací chyby. Aby zůstaly přesné, rámce aplikují škálovací faktory na tenzor nebo blok, které přeškálují hodnoty do použitelného rozsahu FP8. GPU NVIDIA Hopper a Blackwell přidaly hardwarové maticové motory FP8, díky čemuž jsou praktické jak pro trénink, tak pro vyvozování. Novější formáty jako MXFP8, MXFP4 a NVFP4 se díky sdíleným blokům pro mikroškálování posouvají ještě níže.

Technický přehled

Výzvou FP8 je dynamický rozsah. Pouze s hrstkou exponentních bitů velké nebo malé aktivace přetečou nebo nedosáhnou na nulu. Opravou je škálování: vynásobte tenzor faktorem tak, aby jeho hodnoty přistály v reprezentativním okně FP8, proveďte násobení-akumulaci FP8 a poté rozdělte zpět, přičemž často akumulujte dílčí součty s vyšší přesností (FP16/FP32). E4M3 se obvykle používá pro závaží a aktivace, E5M2 pro gradienty, kde záleží více než na přesnosti.

Strategický dopad

Cena a rozpočet

Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.

Jasnější rozhodnutí

Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.

Kontrola kvality

Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.

Budoucnost FP8 a formátů s nízkou přesností

Přesnost letí dolů. Po FP8 přišly 4bitové formáty mikroškálování (MXFP4, NVFP4), které obsahují malé sdílené měřítko na malý blok, a hardware Blackwell nyní přímo akceleruje FP4. Očekávejte receptury se smíšenou přesností, kde různé vrstvy používají různé bitové šířky, plus lepší školení s ohledem na kvantizaci, takže 4bitové se stanou výchozím pro odvození. Konec hry je vytlačit modely v hraničním měřítku na méně levnějších žetonů bez měřitelné ztráty kvality.

Real-World Implementace

Školení velkých jazykových modelů na GPU NVIDIA Hopper/Blackwell pomocí FP8 pro zhruba dvojnásobnou propustnost oproti BF16

Poskytování odvození chatbota v FP8, takže model se vejde na méně GPU a odpovídá na více požadavků za sekundu

Použití E5M2 pro gradientní komunikaci během distribuovaného školení ke snížení šířky pásma sítě mezi uzly

Nasazení kvantovaných modelů MXFP4/NVFP4, aby se model v hraničním měřítku vešel na jeden GPU s velkou pamětí pro levnější odvození

Rizika a zábradlí

Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.

Náklady na infrastrukturu a údržbu jsou často podceňovány.

Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.

Plán implementace

1

Před implementací definujte cíle latence, kvality a nákladů.

2

Benchmark za realistických podmínek zatížení a dat.

3

Monitorování chyb, posunu a dopadu na uživatele.

4

Před škálováním připravte cesty vrácení zpět a reakce na incidenty.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FP8 and Low-Precision Formats quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Formáty serializace modelu

Často kladené otázky

What is FP8 and Low-Precision Formats?

FP8 je 8bitový formát čísel s plovoucí desetinnou čárkou, který umožňuje modelům AI ukládat váhy a spouštět matematiku s využitím čtvrtiny paměti standardních 32bitových čísel. Je to klíčový trik, jak zlevnit obří modely a zrychlit jejich výcvik a obsluhu.

Kolik bitů používá číslo FP8 ve srovnání se standardním číslem FP32?

FP8 používá 8 bitů, zatímco FP32 používá 32 bitů, takže FP8 zabírá jednu čtvrtinu úložiště a šířky pásma.

Co popisky „E4M3“ a „E5M2“ popisují o formátu FP8?

E4M3 znamená 4 exponentní bity a 3 mantisové bity; E5M2 znamená 5 exponentů a 2 bity mantisy. Více exponentních bitů rozšiřuje rozsah; více bitů mantisa zvyšuje přesnost.

Proč potrubí FP8 aplikují škálovací faktory na tenzory?

S tak malým počtem exponentních bitů velké hodnoty přetečou a malé podtečou na nulu. Škálování změní měřítko tenzorů do použitelného okna FP8 před matematikou.

Jaký kompromis je hlavní nevýhodou používání FP8?

Méně bitů znamená hrubší zobrazení a více zaokrouhlovacích chyb. Výhodou je mnohem menší paměť a šířka pásma a rychlejší výpočet na podporovaném hardwaru.

Která generace GPU NVIDIA jako první přidala vyhrazenou hardwarovou podporu pro matici FP8?

GPU založené na Hopperech, jako je H100, zavedly podporu FP8 Tensor Core a Blackwell to později rozšířil na FP4.