FP8 и форматы низкой точности
FP8 — это 8-битный формат чисел с плавающей запятой, который позволяет моделям ИИ хранить веса и выполнять математические вычисления, используя четверть памяти стандартных 32-битных чисел.
Обзор
Это ключевой приём для того, чтобы сделать гигантские модели дешевле и быстрее в обучении и обслуживании.
Глубокое погружение
Нейронные сети состоят из миллиардов чисел. Традиционно в этих числах использовалось 32 бита (FP32) или 16 бит (FP16/BF16) каждое. FP8 сжимает их до 8 бит, сокращая объем памяти и пропускную способность примерно вдвое по сравнению с 16-битными. Существует две распространенные схемы FP8: E4M3 (4 бита экспоненты, 3 бита мантиссы) дает большую точность, но меньший диапазон, и E5M2 (5 экспонент, 2 мантиссы) дает более широкий диапазон, но более грубые шаги. Компромисс — точность: меньшее количество битов означает ошибки округления. Чтобы оставаться точными, платформы применяют коэффициенты масштабирования для каждого тензора или блока, которые масштабируют значения в полезный диапазон FP8. В графические процессоры NVIDIA Hopper и Blackwell добавлены аппаратные матричные механизмы FP8, что делает их практичными как для обучения, так и для вывода. Новые форматы, такие как MXFP8, MXFP4 и NVFP4, еще ниже благодаря общим блокам микромасштабирования.
Техническая информация
Задача FP8 — динамический диапазон. Имея всего несколько битов экспоненты, большие или крошечные активации переполняются или уменьшаются до нуля. Исправление — масштабирование: умножьте тензор на коэффициент, чтобы его значения попали в представимое окно FP8, выполните умножение-накопление FP8, затем обратно разделите, часто накапливая частичные суммы с более высокой точностью (FP16/FP32). E4M3 обычно используется для весов и активаций, E5M2 — для градиентов, где диапазон имеет большее значение, чем точность.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее FP8 и форматов низкой точности
Точность стремительно снижается. После FP8 появились 4-битные форматы микромасштабирования (MXFP4, NVFP4), которые обеспечивают крошечный общий масштаб для каждого небольшого блока, а оборудование Blackwell теперь напрямую ускоряет FP4. Ожидайте рецептов смешанной точности, в которых разные слои используют разную разрядность, а также лучшее обучение с учетом квантования, поэтому 4-битное значение станет стандартным для вывода. Конечная цель — втиснуть модели передового масштаба в меньшее количество более дешевых чипов без заметной потери качества.
Реальная реализация
Обучение больших языковых моделей на графических процессорах NVIDIA Hopper/Blackwell с использованием FP8 для примерно удвоения пропускной способности по сравнению с BF16.
Выполнение выводов чат-бота в FP8, чтобы модель соответствовала меньшему количеству графических процессоров и отвечала на большее количество запросов в секунду.
Использование E5M2 для градиентной связи во время распределенного обучения для сокращения пропускной способности сети между узлами.
Развертывание квантованных моделей MXFP4/NVFP4 для соответствия модели передового масштаба на одном графическом процессоре с большим объемом памяти для более дешевого вывода.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Форматы сериализации моделей
Часто задаваемые вопросы
Что такое FP8 и форматы низкой точности?
FP8 — это 8-битный формат чисел с плавающей запятой, который позволяет моделям ИИ хранить веса и выполнять математические вычисления, используя четверть памяти стандартных 32-битных чисел. Это ключевой трюк, позволяющий сделать гигантские модели дешевле и быстрее в обучении и обслуживании.
Сколько бит использует число FP8 по сравнению со стандартным числом FP32?
FP8 использует 8 бит, а FP32 — 32 бита, поэтому FP8 занимает четверть хранилища и пропускной способности.
Что о формате FP8 говорят метки «E4M3» и «E5M2»?
E4M3 означает 4 бита экспоненты и 3 бита мантиссы; E5M2 означает 5 битов экспоненты и 2 бита мантиссы. Больше битов экспоненты расширяет диапазон; большее количество битов мантиссы повышает точность.
Почему конвейеры FP8 применяют коэффициенты масштабирования к тензорам?
При таком небольшом количестве битов экспоненты большие значения переполняются, а маленькие уменьшаются до нуля. Масштабирование масштабирует тензоры в удобное для использования окно FP8 перед математическими расчетами.
Какой компромисс является основным недостатком использования FP8?
Меньшее количество битов означает более грубое представление и большую ошибку округления. Преимущество — гораздо меньше памяти и пропускной способности, а также более быстрые математические вычисления на поддерживаемом оборудовании.
Какое поколение графических процессоров NVIDIA впервые добавило специальную аппаратную поддержку матричных вычислений FP8?
Графические процессоры на базе Hopper, такие как H100, представили поддержку FP8 Tensor Core, а позже Blackwell расширила ее до FP4.