FP8 і формати низької точності
FP8 — це 8-бітний формат чисел з плаваючою комою, який дозволяє моделям штучного інтелекту зберігати ваги та виконувати математику, використовуючи чверть пам’яті стандартних 32-бітних чисел.
Огляд
It is a key trick for making giant models cheaper and faster to train and serve.
Глибоке занурення
Нейронні мережі складаються з мільярдів чисел. Традиційно ці числа використовували 32 біти (FP32) або 16 бітів (FP16/BF16). FP8 скорочує їх лише до 8 біт, скорочуючи пам’ять і пропускну здатність приблизно вдвічі порівняно з 16-бітними. Є два поширених макети FP8: E4M3 (4 біти експоненти, 3 біти мантиси) дає більшу точність, але менший діапазон, і E5M2 (5 експонент, 2 мантиси) дає ширший діапазон, але грубіші кроки. Компромісом є точність: менша кількість бітів означає помилки округлення. Щоб залишатися точними, фреймворки застосовують коефіцієнти масштабування для кожного тензора або кожного блоку, які перемасштабують значення в діапазон використання FP8. Графічні процесори NVIDIA Hopper і Blackwell додали апаратні механізми матриці FP8, що зробило їх практичними як для навчання, так і для висновків. Новіші формати, як-от MXFP8, MXFP4 і NVFP4, ще нижчі за допомогою спільних блоків мікромасштабування.
Технічне розуміння
Завданням FP8 є динамічний діапазон. Маючи лише кілька бітів експоненти, великі чи дрібні активації переповнюються або занижуються до нуля. Виправлення полягає в масштабуванні: помножте тензор на коефіцієнт, щоб його значення потрапляли у репрезентативне вікно FP8, зробіть FP8 множення-накопичення, потім поділіть назад, часто накопичуючи часткові суми з вищою точністю (FP16/FP32). E4M3 зазвичай використовується для ваг і активацій, E5M2 для градієнтів, де діапазон має значення більше, ніж точність.
Стратегічний вплив
Вартість і бюджет
Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.
Чіткіші рішення
Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.
Контроль якості
Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.
Майбутнє FP8 і низькоточних форматів
Точність стрімко падає. Після FP8 з’явилися 4-розрядні формати мікромасштабування (MXFP4, NVFP4), які містять крихітний спільний масштаб на малий блок, а апаратне забезпечення Blackwell тепер прискорює FP4 напряму. Очікуйте рецепти змішаної точності, де різні шари використовують різну бітову ширину, а також краще навчання з урахуванням квантування, тому 4-біт стає стандартним для висновку. Кінцева гра полягає в тому, що моделі передового масштабу поміщаються на меншу кількість дешевих мікросхем без помітної втрати якості.
Реалізація в реальному світі
Навчання великих мовних моделей на графічних процесорах NVIDIA Hopper/Blackwell за допомогою FP8 для приблизно подвоєння пропускної здатності порівняно з BF16
Обслуговування висновків чат-бота в FP8, щоб модель підходила до меншої кількості графічних процесорів і відповідала на більше запитів на секунду
Використання E5M2 для градієнтного зв’язку під час розподіленого навчання для зменшення пропускної здатності мережі між вузлами
Розгортання квантованих моделей MXFP4/NVFP4 для розміщення моделі граничного масштабу на одному GPU з великим об’ємом пам’яті для здешевлення висновків
Ризики та огорожі
Оптимізація одного тесту може приховати ширші слабкі сторони системи.
Витрати на інфраструктуру та обслуговування часто недооцінюються.
Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.
Дорожня карта впровадження
Визначте цільові показники затримки, якості та вартості перед впровадженням.
Тест за реалістичних умов навантаження та даних.
Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.
Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Формати серіалізації моделі
Часті запитання
What is FP8 and Low-Precision Formats?
FP8 — це 8-бітний формат чисел з плаваючою комою, який дозволяє моделям штучного інтелекту зберігати ваги та виконувати математику, використовуючи чверть пам’яті стандартних 32-бітних чисел. Це ключовий трюк для того, щоб зробити гігантські моделі дешевшими та швидшими для навчання та обслуговування.
Скільки бітів використовує число FP8 порівняно зі стандартним числом FP32?
FP8 використовує 8 бітів, тоді як FP32 використовує 32 біти, тому FP8 займає чверть пам’яті та пропускної здатності.
Що описують мітки «E4M3» і «E5M2» про формат FP8?
E4M3 означає 4 біти експоненти та 3 біти мантиси; E5M2 означає 5 бітів експоненти та 2 мантиси. Більша кількість бітів експоненти розширює діапазон; більше бітів мантиси додають точність.
Чому конвеєри FP8 застосовують коефіцієнти масштабування до тензорів?
З такою малою кількістю бітів експоненти великі значення переповнюються, а крихітні – занижуються до нуля. Масштабування змінює масштаб тензорів у придатне для використання вікно FP8 перед математикою.
Який компроміс є головним мінусом використання FP8?
Менша кількість бітів означає більш грубе представлення та більшу помилку округлення. Перевагою є значно менший обсяг пам’яті та пропускної здатності, а також швидша математика на підтримуваному обладнанні.
Яке покоління графічних процесорів NVIDIA вперше додало виділену апаратну підтримку для матричної математики FP8?
Графічні процесори на основі Hopper, як-от H100, запровадили підтримку FP8 Tensor Core, а Blackwell пізніше розширив це до FP4.