テクニカルガイド

YaRN とコンテキスト長拡張

YaRN (Yet another RoPE extensioN) は、モデルの使用可能なコンテキスト ウィンドウを、トレーニングされたものをはるかに超えて拡張するための効率的な手法です。

2分の読書最終更新日

概要

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

ディープダイブ

最新の LLM は、RoPE (Rotary Position Embedding) を使用してトークンの位置をエンコードし、位置に関連付けられた角度によってクエリとキー ベクトルを回転します。トレーニングの長さよりも長いシーケンスをフィードすると、これらの回転が目に見えない範囲に入り、モデルが壊れます。 Bowen Peng と共同研究者によって 2023 年に導入された YaRN は、周波数ごとに適用される NTK 対応の内挿によってこの問題を修正します。高周波の次元 (局所的で短距離の関係を捕捉する) はほとんど変更されず、低周波の次元 (長距離の位置を追跡する) は補間されます。 YaRN はまた、より長いコンテキストから生じるエントロピーの変化に対抗するために、注意に温度調整を追加します。その結果、単純なアプローチに必要なデータとステップのごく一部のみを微調整した後、強力なロングコンテキストのパフォーマンスが得られます。

技術的な洞察

RoPE は、各埋め込み次元に回転周波数を割り当てます。単純な線形補間では、すべての周波数が均等に圧縮され、局所的な詳細をエンコードする高周波の次元が損なわれます。 YaRN は、ランプ関数を使用して、高周波の次元を維持しながら低周波 (長波長) の次元のみを補間します。さらに、シーケンスの長さが増加してもソフトマックスのシャープネスを安定に保つ 1/sqrt(t) アテンション温度スケーリングを使用します。この NTK ごとのアプローチは、劣化を大幅に抑えてコンテキストを拡張します。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

YaRN とコンテキスト長拡張の将来

コンテキスト拡張は現在標準的な手法です。オープン モデルは、128,000 トークン以上に達する YaRN 拡張バリアントを定期的に出荷します。研究は、ゼロまたはゼロに近い微調整でコンテキストを拡張し、RoPE の再スケーリングと注意パターンのトリックを組み合わせ、端だけでなくウィンドウ全体で品質を維持する方法に向かって進んでいます。これらの手法が事前トレーニングに緊密に統合されるため、長いコンテキストは後付けではなくネイティブになることが予想されます。

現実世界の実装

オープン 4K コンテキスト モデルを 32K または 128K に拡張し、簡単な微調整で長い文書の質問に答えることができます。

検索拡張システムで、多くの連結されたパッセージを切り詰めることなく取り込めるようにする

1 つのプロンプトで大きなリポジトリ ファイル全体または複数のファイルを必要とするコード アシスタントを強化する

大量のチャット履歴を蓄積する長いマルチターン会話に基本モデルを適応させる

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

コンテキスト拡張の​​ための位置補間

よくある質問

What is YaRN and Context Length Extension?

YaRN (Yet another RoPE extensioN) は、モデルの使用可能なコンテキスト ウィンドウを、トレーニングされたものをはるかに超えて拡張するための効率的な手法です。回転位置の埋め込みを巧みに再スケーリングするので、たとえば 4K トークンでトレーニングされたモデルは最小限の微調整で 32K 以上を処理できます。

YaRN はコンテキストを拡張するためにどの位置エンコーディング方法を変更しますか?

YaRN は、「さらにもう 1 つの RoPE 拡張機能」を意味する名前で、最新の LLM で使用される回転位置の埋め込みを再スケーリングします。

RoPE モデルがトレーニング長よりも長いシーケンスを認識すると何が問題になるのでしょうか?

トレーニングを超えた位置では、モデルが見たことのない回転角度が生成されるため、注意力の動作が急激に低下します。

YaRN はさまざまな RoPE 周波数次元をどのように処理しますか?

YaRN は、長波長の低周波数の調光を補間し、短距離の高周波数の調光をほとんどそのまま残す NTK ごとのランプを使用します。

周波数の再スケーリング以外に、YaRN はどのような追加調整を適用しますか?

YaRN は、コンテキストの成長に伴って発生するエントロピー シフトに対抗するために、注意ロジットに温度スケーリングを追加します。

単純な補間に対する YaRN の主な実際的な利点は何ですか?

YaRN は、ナイーブ手法が必要とするデータのごく一部を微調整した後、強力なロングコンテキスト品質を実現します。