FP8 および低精度フォーマット
FP8 は、AI モデルが重みを保存し、標準の 32 ビット数値の 4 分の 1 のメモリを使用して計算を実行できる 8 ビット浮動小数点数形式です。
概要
It is a key trick for making giant models cheaper and faster to train and serve.
ディープダイブ
ニューラル ネットワークは数十億の数値で構成されています。従来、これらの数値にはそれぞれ 32 ビット (FP32) または 16 ビット (FP16/BF16) が使用されていました。 FP8 はそれらをわずか 8 ビットに縮小し、メモリと帯域幅を 16 ビットのおよそ半分に削減します。一般的な FP8 レイアウトは 2 つあります。E4M3 (指数部 4 ビット、仮数部 3 ビット) は精度は高くなりますが、範囲は狭くなります。E5M2 (指数部 5 ビット、仮数部 2 ビット) は範囲は広くなりますが、ステップは粗くなります。トレードオフは忠実度です。ビットが少ないほど、丸め誤差が生じます。正確さを保つために、フレームワークはテンソルごとまたはブロックごとのスケーリング係数を適用して、値を FP8 の使用可能な範囲に再スケーリングします。 NVIDIA の Hopper GPU と Blackwell GPU にはハードウェア FP8 マトリックス エンジンが追加され、トレーニングと推論の両方に実用的になりました。 MXFP8、MXFP4、NVFP4 などの新しい形式は、共有マイクロスケーリング ブロックを使用してさらに低くなります。
技術的な洞察
FP8 の課題はダイナミック レンジです。少数の指数ビットだけを使用すると、大規模または小規模のアクティベーションがオーバーフローまたはアンダーフローしてゼロになります。修正はスケーリングです。テンソルに係数を掛けて、その値が FP8 の表現可能なウィンドウに収まるようにし、FP8 の積和演算を行ってから除算を戻し、多くの場合、より高精度で部分和を累積します (FP16/FP32)。通常、E4M3 は重みとアクティベーションに使用され、E5M2 は精度よりも範囲が重要な勾配に使用されます。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
FP8 と低精度フォーマットの将来
精度は急激に低下しています。 FP8 の後には、小さなブロックごとに小さな共有スケールをパックする 4 ビット マイクロ スケーリング フォーマット (MXFP4、NVFP4) が登場し、Blackwell ハードウェアは FP4 を直接高速化するようになりました。異なるレイヤーが異なるビット幅を使用する混合精度のレシピに加えて、量子化を考慮したトレーニングが改善され、4 ビットが推論のデフォルトになることが期待されます。最終目標は、測定可能な品質の損失なしに、フロンティアスケールのモデルをより少数のより安価なチップに押し込むことです。
現実世界の実装
FP8 を使用して NVIDIA Hopper/Blackwell GPU で大規模な言語モデルをトレーニングすると、BF16 と比較してスループットが約 2 倍になります
FP8 でチャットボット推論を提供することで、モデルがより少ない GPU に適合し、1 秒あたりより多くのリクエストに応答できるようになります
分散トレーニング中の勾配通信に E5M2 を使用してノード間のネットワーク帯域幅を削減する
MXFP4/NVFP4 量子化モデルをデプロイしてフロンティアスケールのモデルを単一のハイメモリ GPU に適合させ、推論を安価に実現
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
モデルのシリアル化形式
よくある質問
What is FP8 and Low-Precision Formats?
FP8 は、AI モデルが重みを保存し、標準の 32 ビット数値の 4 分の 1 のメモリを使用して計算を実行できる 8 ビット浮動小数点数形式です。これは、巨大なモデルをより安く、より速くトレーニングして提供するための重要なトリックです。
FP8 数値は標準の FP32 数値と比較して何ビットを使用しますか?
FP8 は 8 ビットを使用し、FP32 は 32 ビットを使用するため、FP8 はストレージと帯域幅の 4 分の 1 を使用します。
「E4M3」および「E5M2」ラベルは FP8 フォーマットについて何を説明していますか?
E4M3 は、4 つの指数ビットと 3 つの仮数ビットを意味します。 E5M2 は、5 つの指数ビットと 2 つの仮数ビットを意味します。指数ビットが増えると範囲が広がります。仮数ビットを増やすと精度が上がります。
FP8 パイプラインがテンソルにスケーリング係数を適用するのはなぜですか?
指数ビットが非常に少ないと、大きな値はオーバーフローし、小さな値はアンダーフローしてゼロになります。スケーリングは、計算の前にテンソルを FP8 の使用可能なウィンドウに再スケーリングします。
FP8 を使用することの主な欠点はどのトレードオフですか?
ビットが少ないほど、表現が粗くなり、丸め誤差が大きくなります。利点は、メモリと帯域幅がはるかに少なくなり、サポートされているハードウェアでの計算が高速になることです。
FP8 行列演算の専用ハードウェア サポートを最初に追加したのは、どの NVIDIA GPU 世代ですか?
H100 のようなホッパーベースの GPU では FP8 Tensor コアのサポートが導入され、Blackwell は後にこれを FP4 まで拡張しました。