言語AIガイド

命令チューニング

命令チューニングは、生のテキスト予測子を、「これを要約してください」や「丁寧な返事を書いてください」などの命令に実際に従うモデルに変えるトレーニング ステップです。これにより、ベースモデルが便利で操作しやすくなります。

2分の読書最終更新日

ディープダイブ

基本言語モデルは、Web テキスト上の次のトークンを予測するためだけにトレーニングされるため、質問を入力すると、回答せずにさらに質問が続く可能性があります。命令チューニングによりこれが修正されます。これは教師あり微調整の一種です。モデルは、翻訳、要約、分類、Q&A、コーディングなど、数千のタスクをカバーする多くのペア (命令、理想的な応答) でトレーニングされます。同じ指示、その後役立つ回答のパターンを繰り返し見ることで、モデルは「ユーザーの要求に従う」という一般的な動作を学習し、これがトレーニングでは見たことのない指示に一般化されます。このアプローチは、FLAN、T0、Natural 命令などの研究によって 2021 年頃に確立され、厳選された命令プロンプトのセットに基づいて GPT-3 を微調整する OpenAI の InstructGPT の中心となっていました。これは、ほとんどのチャット アシスタントが構築される基盤です。

技術的な洞察

機械的には、命令チューニングは標準的な教師あり学習です。つまり、重みを更新する勾配を使用して、モデルの予測トークンと参照応答との差を最小限に抑えます。これは、報酬モデルを使用して人間の好みに合わせて最適化する RLHF (人間のフィードバックからの強化学習) とは異なります。通常のレシピは階層化されています。事前トレーニング、次にタスクのフォローを教えるための命令調整 (SFT)、次にオプションでトーン、有用性、安全性を調整するための RLHF です。データの多様性は、膨大な量よりも重要です。幅広いタスクをカバーすることで一般化が促進されます。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

命令チューニングの未来

データの質が量に勝つことができるという発見を受けて、この分野は、巨大な手書きのデータセットから、より高品質で部分的に合成されたデータ(場合によっては、慎重に選ばれたわずか数千のサンプル)へと移行しつつあります。より多くのドメイン固有の指示チューニング (医療、法律、コーディング)、多言語およびマルチモーダルな指示セット、指示データを生成およびフィルタリングする自動パイプラインが期待されます。命令チューニングは、生の事前トレーニング済みモデルと使用可能なアシスタントの間の重要な橋渡しであり続け、調整のための優先順位の最適化と組み合わせられることが増えています。

現実世界の実装

基本の GPT スタイル モデルを、質問をエコーするのではなく応答するチャット アシスタントに変える

FLAN-T5 は、多くのタスクにわたって微調整されているため、明示的にトレーニングされていない指示に従うことができます。

InstructGPT。GPT-3 は厳選されたプロンプトに基づいて命令調整され、より役立つ応答を生成します。

サポートチームと法務チームが作成した指示と回答のペアを微調整して社内アシスタントを構築する

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Instruction Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

プレフィックスチューニング

よくある質問

What is Instruction Tuning?

命令チューニングは、生のテキスト予測子を、「これを要約してください」や「丁寧な返事を書いてください」などの命令に実際に従うモデルに変えるトレーニング ステップです。これにより、ベースモデルが便利で操作しやすくなります。

命令チューニングは RLHF とどのように異なりますか?

命令チューニングは、ターゲットの応答に関する教師あり学習です。 RLHF はその後に登場し、学習した人間の好みに基づいてモデルを最適化します。

新しい未知の命令に従うモデルの能力を最も促進する命令チューニング データの特性は何ですか?

幅広いタスクをカバーすることで、指示に従うという一般的な動作を学び、トレーニングでは決して見られなかった指示に一般化されます。

最近のチャット アシスタントのトレーニング段階の一般的な順序はどれですか?

モデルはまず生のテキストで事前トレーニングされ、次にタスクに従うように命令が調整され、多くの場合、トーンと安全性のために RLHF で調整されます。