テクニカルガイド

スケジュールされたサンプリングと露出バイアス

露出バイアスは、完全なプレフィックスのみでトレーニングされたモデルが、推論上、それ自体の不完全な出力を条件付けする必要がある場合に生じるギャップです。

2分の読書最終更新日

概要

Scheduled sampling is a curriculum that gradually closes that gap.

ディープダイブ

教師強制でトレーニングされたモデルは、グラウンドトゥルース トークンをコンテキストとしてのみ認識しますが、生成時には独自の予測をフィードバックします。初期のミスによりモデルがトレーニング中に決して遭遇しなかった状態になると、エラーが雪だるま式に増加する可能性があり、これは露出バイアスと呼ばれる故障モードです。 Bengio らによって 2015 年に導入されたスケジュールされたサンプリングは、トレーニング中の各デコード ステップでコインを投げることによってこの問題に対処します。一定の確率で真のトークン (教師による強制) が供給され、そうでない場合はモデル自身のサンプリングされた予測が供給されます。グラウンド トゥルースを使用する確率は 1 付近から始まり、スケジュール (線形、指数関数、または逆シグモイド) によるトレーニングが進むにつれて減衰するため、モデルは徐々に自身の出力にさらされ、間違いから回復する方法を学習します。

技術的な洞察

ステップ t で、モデルはゴールド トークンを選択する確率 epsilon_i でベルヌーイ変数をサンプリングします。 epsilon_i はトレーニングが進むにつれて減衰します。微妙な点は、サンプリングされたトークンを供給すると目的にバイアスがかかり、離散サンプリングが微分不可能になるため、フィードバックされたトークンを介して勾配がきれいに流れないことです。バリアントはこれを軽減するためにストレート スルー ガンベル ソフトマックスまたは微分可能な緩和を使用し、シーケンス レベルのメソッドは BLEU などのメトリクスを直接最適化します。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

スケジュールされたサンプリングと露出バイアスの将来

大規模な Transformer 言語モデルの場合、膨大なデータと規模によって露出バイアスが弱まり、RLHF のような手法で生成動作が直接変更されるため、露出バイアスの実際的な影響が議論されています。それでも、スケジュールされたサンプリングとその子孫は、小規模なモデル、構造化された生成、および厳密な精度が必要なタスクに引き続き関連します。今後の取り組みでは、カリキュラムの公開、強化スタイルのシーケンス目標、および最小リスクのトレーニングを組み合わせて、モデルのトレーニング方法と実際のデコード方法を調整します。

現実世界の実装

スケジュールされたサンプリングを使用して画像キャプション モデルをトレーニングし、不完全な予測単語の後に適切に続行することを学習します。

ニューラル機械翻訳システムにおける逆シグモイド スケジュールによる教師強制確率の減衰

支離滅裂なループに陥るチャットボットを、純粋な教師の強制による暴露バイアスの症状と診断する

完全な教師強制でトレーニングされたサマライザーと、スケジュールされたサンプリングでトレーニングされたサマライザーの BLEU スコアの比較

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scheduled Sampling and Exposure Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

ネガティブサンプリングとノイズ対比推定

よくある質問

What is Scheduled Sampling and Exposure Bias?

露出バイアスは、完全なプレフィックスのみでトレーニングされたモデルが、推論上、それ自体の不完全な出力を条件付けする必要がある場合に生じるギャップです。計画的サンプリングは、そのギャップを徐々に埋めるカリキュラムです。

スケジュールされたサンプリングはトレーニング中に何を行いますか?

スケジュールされたサンプリングでは、デコーダの入力としてグラウンドトゥルースとモデル生成のトークンが確率的に混合され、減衰する確率によって制御されます。

グラウンドトゥルース トークンを使用する確率は、スケジュールされたサンプリングでのトレーニングによってどのように変化しますか?

スケジュールは教師による強制にほぼ達するまで始まり減衰するため、モデルが改善されるにつれてモデル自身の予測にさらされることが多くなります。

計画的サンプリングを導入したのは誰ですか、そしておおよそいつですか?

計画的サンプリングは、2015 年にリカレント ネットワークでのシーケンス予測のために Samy Bengio らによって提案されました。

教師による強制の確率を低下させるためによく挙げられるスケジュールの形はどれですか?

オリジナルの研究では、グラウンドトゥルースのサンプリング確率を減らすために、線形、指数関数、および逆シグモイド減衰スケジュールを提案しました。