テクニカルガイド

高帯域幅メモリ

高帯域幅メモリ (HBM) は、GPU のすぐ隣に配置されたスタック型メモリで、通常の RAM よりもはるかに高速にデータを配信します。

2分の読書最終更新日

概要

It is what keeps AI accelerators fed, preventing the powerful compute cores from sitting idle while they wait for model weights and data.

ディープダイブ

HBM は基本的なボトルネックを解決します。最新の AI チップは 1 秒あたり数兆回の操作を実行できますが、それはデータが十分に速く到着する場合に限られます。標準の GDDR メモリは比較的狭いバスを介して接続されますが、HBM は複数の DRAM ダイを垂直に積み重ね、シリコン貫通ビア (TSV) と呼ばれる数千の小さな垂直ワイヤでそれらを接続します。これらのスタックは GPU から数ミリメートル離れたシリコン インターポーザー上に配置され、非常に幅広いデータ パスを提供し、一度に数百ビットではなく数千ビットを処理します。その結果、帯域幅は 1 秒あたりのテラバイト単位で測定されます。 HBM2 から HBM2e、HBM3、HBM3e と世代が進み、それぞれの容量と速度の両方が向上しました。重みを継続的にストリーミングする必要がある大規模な言語モデルの場合、生のコンピューティングよりも HBM の容量と帯域幅が重要になることがよくあります。

技術的な洞察

HBM は、より高いクロック レートではなく、極端な並列処理によって速度を実現します。 DRAM ダイをスタックし、それらを何千もの TSV とリンクすることにより、非常に幅広いインターフェイス (スタックあたり 1024 ビット以上) が公開され、非常に多くのバイトが同時に移動します。スタックを GPU の横の共有インターポーザーに配置すると、配線が短くなり、ビットあたりの電力と遅延が削減されます。 NVIDIA H100 や H200 のような単一のアクセラレータは、複数の HBM スタックをペアにして、合計メモリ帯域幅を 1 秒あたり数テラバイトに達します。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

高帯域幅メモリの未来

メモリ帯域幅は現在、AI に対する主な制約となっているため、HBM は急速に進歩しています。 HBM3e は主力アクセラレータとして出荷されており、HBM4 の登場により、より広いインターフェイス、より高いスタック、およびパッケージあたりの容量の増加が期待されています。メモリとロジックの間の緊密な共同設計、おそらくカスタムベースのダイとメモリ付近の処理に加え、SK ハイニックス、サムスン、マイクロンなどのサプライヤー間の熾烈な競争が予想されます。モデルが成長するにつれて、より多くのデータをコンピューティングに近づけ、より速く、より低いエネルギーで取得することが、AI ハードウェアの進歩の中心であり続けます。

現実世界の実装

大規模な言語モデルの数十ギガバイトまたは数百ギガバイトの重みを GPU の近くに保持して、各推論ステップ中にストリーミングできるようにします。

NVIDIA H100 および H200 データセンター GPU がトレーニング用に 1 秒あたり数テラバイトのメモリ帯域幅に到達できるようにします。

多くの GPU がそれぞれ HBM に依存する AI トレーニング クラスターを強化して、マトリックス演算間の停止を回避します。

巨大な活性化テンソルをメモリの内外に迅速に移動する必要がある高解像度の生成画像およびビデオ モデルをサポートします。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the High Bandwidth Memory quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

GPU メモリ管理と断片化

よくある質問

What is High Bandwidth Memory?

高帯域幅メモリ (HBM) は、GPU のすぐ隣に配置されたスタック型メモリで、通常の RAM よりもはるかに高速にデータを配信します。これは、AI アクセラレータに供給を継続し、モデルの重みとデータを待機している間に強力なコンピューティング コアがアイドル状態になるのを防ぎます。

高帯域幅メモリは AI アクセラレータにとってどのような主な問題に対処しますか?

AI チップは、データが十分に速く到着する場合にのみ、1 秒あたり数兆回の演算を実行できます。 HBM はコアが不足しないようにその帯域幅を提供します。

HBM は通常の GDDR メモリと物理的にどのように構築されていますか?

HBM は、DRAM ダイを互いに積み重ねて数千の垂直ワイヤ (TSV) でリンクし、非常に幅の広いデータ パスを作成します。

HBM は高帯域幅を実現するために主に何に依存していますか?

HBM はクロックを速くするのではなく、非常に幅広いインターフェイス (スタックあたり 1024 ビット以上) を公開するため、一度に多くのバイトが移動します。

HBM スタックが GPU のすぐ隣のシリコン インターポーザーに配置されているのはなぜですか?

共有インターポーザ上の短いワイヤにより、転送されるビットごとに必要なエネルギーが低減され、メモリとコンピューティング間の遅延が短縮されます。

特に大規模な言語モデルの場合、HBM が生のコンピューティングと同じくらい重要になるのはなぜでしょうか?

LLM 推論は大きな重み行列を継続的にストリーミングするため、多くの場合、計算スループットよりもメモリ容量と帯域幅が制限要因になります。