FP8 и формати с ниска точност
FP8 е 8-битов числов формат с плаваща запетая, който позволява на AI моделите да съхраняват тегла и да изпълняват математика, използвайки една четвърт от паметта на стандартните 32-битови числа.
Преглед
It is a key trick for making giant models cheaper and faster to train and serve.
Дълбоко гмуркане
Невронните мрежи са изградени от милиарди числа. Традиционно тези числа използват 32 бита (FP32) или 16 бита (FP16/BF16) всяко. FP8 ги свива до само 8 бита, намалявайки паметта и честотната лента приблизително наполовина в сравнение с 16-битовите. Има две често срещани оформления на FP8: E4M3 (4 бита за експонента, 3 бита за мантиса) дава по-голяма точност, но по-малък диапазон, и E5M2 (5 бита за експонента, 2 мантиса) дава по-широк диапазон, но по-груби стъпки. Компромисът е вярност: по-малко битове означават грешки при закръгляване. За да останат точни, рамките прилагат коефициенти за мащабиране на тензор или на блок, които премащабират стойностите в използваемия диапазон на FP8. Графичните процесори Hopper и Blackwell на NVIDIA добавиха хардуерни FP8 матрични машини, което го направи практично както за обучение, така и за изводи. По-нови формати като MXFP8, MXFP4 и NVFP4 натискат още по-ниско със споделени блокове за микро мащабиране.
Техническа информация
Предизвикателството на FP8 е динамичният обхват. Само с шепа експонентни битове, големи или малки активации препълват или намаляват до нула. Поправката е мащабиране: умножете тензор по коефициент, така че стойностите му да попаднат в прозореца за представяне на FP8, направете FP8 умножение-натрупване, след което разделете обратно, често натрупвайки частични суми с по-висока точност (FP16/FP32). E4M3 обикновено се използва за тежести и активации, E5M2 за градиенти, където диапазонът има повече значение от точността.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на FP8 и форматите с ниска точност
Прецизността върви надолу. След FP8 дойдоха 4-битови формати за микро мащабиране (MXFP4, NVFP4), които пакетират малък споделен мащаб на малък блок, а хардуерът на Blackwell сега ускорява директно FP4. Очаквайте рецепти със смесена прецизност, при които различните слоеве използват различни битови ширини, плюс по-добро обучение за квантуване, така че 4-битовото става по подразбиране за извод. Крайната игра е изтласкване на модели от граничен мащаб върху по-малко, по-евтини чипове без измерима загуба на качество.
Внедряване в реалния свят
Обучение на големи езикови модели на NVIDIA Hopper/Blackwell GPU с помощта на FP8 за грубо удвояване на пропускателната способност спрямо BF16
Обслужване на изводи за chatbot в FP8, така че моделът да пасва на по-малко GPU и да отговаря на повече заявки в секунда
Използване на E5M2 за градиентна комуникация по време на разпределено обучение за намаляване на честотната лента на мрежата между възлите
Внедряване на MXFP4/NVFP4-квантувани модели, за да се побере модел с граничен мащаб на един GPU с висока памет за по-евтини изводи
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Формати за сериализиране на модели
Frequently asked questions
What is FP8 and Low-Precision Formats?
FP8 е 8-битов числов формат с плаваща запетая, който позволява на AI моделите да съхраняват тегла и да изпълняват математика, използвайки една четвърт от паметта на стандартните 32-битови числа. Това е ключов трик, за да направите гигантските модели по-евтини и по-бързи за обучение и обслужване.
Колко бита използва едно число FP8 в сравнение със стандартно число FP32?
FP8 използва 8 бита, докато FP32 използва 32 бита, така че FP8 заема една четвърт от съхранението и честотната лента.
Какво описват етикетите „E4M3“ и „E5M2“ за формат FP8?
E4M3 означава 4 бита експонента и 3 бита мантиса; E5M2 означава 5 експонента и 2 бита мантиса. Повече експонентни битове разширяват диапазона; повече мантисови битове добавят прецизност.
Защо тръбопроводите FP8 прилагат коефициенти на мащабиране към тензорите?
С толкова малко експонентни битове, големите стойности се препълват, а малките се препълват до нула. Мащабирането премащабира тензорите в използваемия прозорец на FP8 преди математиката.
Кой компромис е основният недостатък на използването на FP8?
По-малко битове означават по-грубо представяне и повече грешки при закръгляване. Предимството е много по-малко памет и честотна лента и по-бърза математика на поддържания хардуер.
Кое поколение GPU на NVIDIA първо добави специална хардуерна поддръжка за FP8 матрична математика?
Базираните на Hopper графични процесори като H100 въведоха поддръжка на FP8 Tensor Core, а Blackwell по-късно разшири това до FP4.