まばらな注意パターン
各トークンが他のトークンのすべてではなく慎重に選択されたサブセットのみに関与するようにすることで、注目がまばらになり、トランスフォーマーのコストが安くなります。
概要
This trades a little global reach for big savings in memory and compute on long sequences.
ディープダイブ
完全なセルフアテンションでは、すべてのトークンを他のすべてのトークンと比較するため、シーケンスの長さの 2 乗に応じてコストが増加し、長いドキュメントでは負担が大きくなります。注意力がまばらになると、密集したパターンが構造化されたパターンに置き換えられます。一般的な設計には、各トークンが近隣のトークンのみを認識するスライディング ウィンドウ (ローカル) アテンションが含まれます。遠くのコンテキストに安価に到達するために先にスキップする、ストライドまたは拡張されたパターン。そしてグローバルトークンは、情報ハブとして機能し、すべてを担当し、すべてが担当するいくつかの特別な役職です。 Longformer、BigBird、Sparse Transformer などのモデルはこれらを組み合わせているため、接続の総数は二次関数ではなくほぼ直線的に増加し、数千から数万のトークンのコンテキストが可能になります。
技術的な洞察
完全な N 行 N 列のアテンション行列の代わりに、スパース アテンションは選択されたエントリのみを計算します。多くの場合、ローカル ウィンドウと少数のグローバル行および列の結合です。 BigBird は、ランダム接続、ウィンドウ接続、およびグローバル接続を組み合わせると、複雑さを O(N 乗) から O(N) に削減しながら、完全な注意による理論的な表現力を維持できることを証明したことで有名です。効率的なカーネルは、マスクされたエントリを計算してゼロにするのではなく、完全にスキップします。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
まばらな注意パターンの未来
スパース アテンションは依然としてロング コンテキスト モデリングの中心であり、FlashAttendant のような最適化されたカーネルや、入力ごとにどのトークンに注目するかを選択する学習されたスパース性または動的なスパース性と組み合わせられることが増えています。コンテキスト ウィンドウが数百万のトークンに向かって拡張されると、ハイブリッド スタックでは疎層、密層、状態空間層が混在します。ハードウェア対応のスパース カーネルとルーティング ベースの注意により、非常に長い入力の読み取りコストが削減され続けることが期待されます。
現実世界の実装
長年にわたり、スライディング ウィンドウを使用して科学論文や法律文書全体を 1 回のパスで処理し、世界的な注目を集めました
BigBird は、線形スケーリングの注意を払って長い文書の質問応答とゲノミクス配列を処理します
完全に注意を払うと GPU メモリが使い果たされるような、本ほどの長さのテキストを要約する
グローバル ハブ トークンを使用して数千のトークン間で重要な情報をルーティングする、検索およびロングコンテキスト チャット システム
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sparse Attention Patterns quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ブロックスパースおよびネイティブスパースアテンション
よくある質問
What is Sparse Attention Patterns?
各トークンが他のトークンのすべてではなく慎重に選択されたサブセットのみに関与するようにすることで、注目がまばらになり、トランスフォーマーのコストが安くなります。これにより、グローバルな範囲が少し広くなる代わりに、メモリと長いシーケンスの計算が大幅に節約されます。
長いシーケンスで完全に注意を払うとコストがかかるのはなぜですか?
完全な注意を払うと、すべてのトークンが他のすべてのトークンと比較され、時間とメモリのコストが O(N の 2 乗) になります。
スライディング ウィンドウ (ローカル) アテンションとは何ですか?
ローカルな注目により、各トークンの表示が周囲のトークンの固定ウィンドウに制限され、コストが大幅に削減されます。
注目が乏しい中での「グローバルトークン」の目的は何でしょうか?
いくつかのグローバル トークンがすべてのポジションに接続され、情報がシーケンス全体に低コストで流れるようになります。
ランダム、ウィンドウ、およびグローバル アテンションを組み合わせることで、フル アテンションの表現力が維持されることを証明したモデルはどれですか?
BigBird は、そのスパース パターンがシーケンス関数の普遍的な近似器であると同時に、ほぼ線形にスケーリングすることを示しました。
適切に設計された注目度の低い環境では、接続数はどのように増加するのでしょうか?
接続をローカル ウィンドウといくつかのグローバル リンクに制限することで、合計接続数はほぼ直線的に増加します。