テンソルコア
Tensor コアは、最新の NVIDIA GPU 内の特殊なハードウェア ユニットであり、行列の積和演算を非常に高速に実行します。
概要
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
ディープダイブ
2017 年に Volta アーキテクチャで導入された Tensor コアは、標準の CUDA コアで一度に 1 つずつ乗算を行うのではなく、小さな行列の乗算と加算 (D = A x B + C) を 1 回の操作で計算する専用回路です。ニューラル ネットワークの事実上すべての層が行列の乗算に帰着するため、これは AI が実際に必要とする数学と一致します。 GPU の世代ごとに処理対象が拡張されました。Volta では 4x4 FP16 タイルが使用され、その後の Ampere、Hopper、Blackwell アーキテクチャでは TF32、BF16、INT8、FP8、FP4 などの低精度フォーマットが追加されました。精度が低いと、クロックごとに処理される数が多くなり、精度を許容範囲に保ちながら、トレーニングと推論のスループットが大幅に向上します。
技術的な洞察
Tensor コアは、同じ入力値が多くの出力要素で再利用されるという事実を利用して、2 つの小さな行列を乗算し、その結果を 1 つの融合ステップで累積します。通常、入力は低い精度 (FP16、BF16、または FP8) で読み取りますが、丸め誤差を制限するために、より高い精度 (多くの場合 FP32) で累計を累積します。 cuBLAS や cuDNN などのソフトウェア ライブラリや、PyTorch などのフレームワークは、大きな行列をこれらの小さなブロックに自動的に並べて配置するため、手動でコーディングすることなくモデルの速度が向上します。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
Tensor コアの将来
Tensor コアは、より低い精度に向かって進み続けています。Hopper は FP8 を追加し、Blackwell はハードウェア管理のスケーリングを備えた 4 ビット FP4 を導入し、推論の負荷が高いワークロードの各ステップのスループットを約 2 倍にしました。スパース性 (ゼロの重みをスキップする)、数値の小さなブロックにスケール ファクターを付加するマイクロスケーリング フォーマット、およびコアへの供給を維持するためのメモリ システムとのより深い統合に対するより緊密なサポートが期待されます。モデルが成長しても、生のクロック速度ではなく、マトリックス エンジンが AI ハードウェア パフォーマンスの中心的な戦場であり続けます。
現実世界の実装
GPT スタイルのトランスフォーマーのような大規模な言語モデルのトレーニング。ステップごとに数十億の行列乗算が BF16 または FP8 の Tensor コアで実行されます。
INT8 または FP8 量子化を使用してチャットボットと画像ジェネレーターのリアルタイム推論を実行し、GPU あたりにより多くのユーザーにサービスを提供します。
ビデオ ゲームにおける NVIDIA DLSS を高速化します。ニューラル ネットワークは、各フレームで Tensor コアを使用して低解像度のフレームをアップスケールします。
マトリックスを多用するニューラル ワークロードとして再定式化されたプロテイン フォールディング (AlphaFold) や気象モデルなどの科学コンピューティングを高速化します。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
大規模モデルのテンソル並列処理
よくある質問
What is Tensor Cores?
Tensor コアは、最新の NVIDIA GPU 内の特殊なハードウェア ユニットであり、行列の積和演算を非常に高速に実行します。これらが、単一の GPU が汎用コンピューティングで許容されるよりも桁違いに高速に大規模なニューラル ネットワークをトレーニングおよび実行できる主な理由です。
Tensor コアはどのコア数学演算を加速するために特別に設計されていますか?
Tensor コアは、融合行列の乗算と累積を 1 ステップで実行します。これはまさにニューラル ネットワーク層を支配する操作です。
Tensor コアを最初に導入した NVIDIA GPU アーキテクチャはどれですか?
Tensor コアは 2017 年に Volta アーキテクチャでデビューし、FP16 4x4 マトリックス演算から始まりました。
Tensor コアが FP16 や FP8 などの低い精度を使用することが多いのはなぜですか?
数値あたりのビット数が少なくなると、各サイクルでより多くの値がハードウェアを通過することになり、通常は許容できる程度のわずかな精度の損失のみで速度が大幅に向上します。
精度を維持するために、Tensor コアは通常、累計 (累積) にどの程度の精度を使用しますか?
入力の精度は低い場合がありますが、アキュムレータは通常、丸め誤差の蓄積を制限するために FP32 のような高精度で実行されます。
PyTorch などの日常的な AI フレームワークは Tensor コアをどのように利用するのでしょうか?
基盤となるライブラリは、大きな行列演算を Tensor コア サイズのタイルに自動的に分割するため、フレームワークは手動コーディングなしで高速化されます。