自己 RAG とリフレクティブ検索
Self-RAG は、言語モデルがいつ取得するかを決定し、取得したパッセージと独自の出力の両方を特別なリフレクション トークンを使用して批評するフレームワークです。
概要
It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.
ディープダイブ
標準 RAG は、必要ない場合でも入力ごとに固定数のパッセージを取得し、答えが実際にサポートされているかどうかを検証しません。 Asai 氏らによって 2023 年に導入された Self-RAG は、オンデマンドで 3 つのことを実行できるように単一のモデルをトレーニングします。まず、外部の知識が必要かどうかを決定する「取得」トークンを発行します。次に、取得後、各パッセージが役立つかどうかを判断する「IsRelevant」批評トークンを発行します。 3 番目に、自身のステートメントが証拠に基づいているかどうか、および応答がどの程度優れているかを評価する「IsSupported」および「IsUseful」トークンを生成します。これらのリフレクション トークンにより、システムは保証された場合にのみ取得し、無関係なパッセージをフィルタリングし、モデル自体が十分にサポートされていると評価した出力を優先して幻覚を軽減します。
技術的な洞察
Self-RAG は、多くの場合 GPT-4 などのより強力なモデルから抽出された、リフレクション トークンでラベル付けされたデータに対する教師あり学習を介してトレーニングされます。推論時に、モデルは通常のテキスト トークンとこれらの特別な制御トークンをインターリーブします。セグメントレベルのビーム検索では、批評トークンの確率を使用して候補継続をスコアリングできるため、開発者は実行時の動作を調整できます。たとえば、「IsSupported」の重み付けをより重くして、事実に基づく根拠と流暢性を最大限に高めることができます。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
Self-RAG とリフレクティブ検索の未来
リフレクティブ検索はエージェント RAG と収束しており、モデルは複数ステップの検索を計画し、ツールを呼び出し、繰り返し全体で自己修正します。自己批判と検証モデル、ナレッジ グラフの検索、および忠実でよく引用された回答に報いる強化学習とのより緊密な統合が期待されます。推論モデルが成熟するにつれて、オンデマンドおよび自己評価による検索は、個別のフレームワークではなくデフォルトの動作になる可能性が高く、各主張に必要な証拠の量をモデルが動的に決定します。
現実世界の実装
医療 Q&A アシスタントは、「取得」決定トークンを使用して、臨床質問のガイドラインのみを取得し、挨拶の取得をスキップします。
研究アシスタントは、執筆前に各文章の「IsRelevant」批評をチェックすることで、主題から外れた検索ヒットを除外します。
エンタープライズ チャットボットは、「IsSupported」タグが付けられた回答を優先するため、その発言は会社の文書に基づいたものとなり、幻覚がカットされます。
ファクトチェックツールは、「IsUseful」スコアを使用して複数の回答候補をランク付けし、最も証拠の高い回答を明らかにします。
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-RAG and Reflective Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
投機的 RAG と検索拡張ドラフティング
よくある質問
What is Self-RAG and Reflective Retrieval?
Self-RAG は、言語モデルがいつ取得するかを決定し、取得したパッセージと独自の出力の両方を特別なリフレクション トークンを使用して批評するフレームワークです。これが重要なのは、クエリごとに盲目的にドキュメントをフェッチするのではなく、検索拡張生成を適応的かつ自己チェックできるようにするためです。
標準 RAG では行われない、Self-RAG での重要な決定は何ですか?
Self-RAG は、常に取得するのではなく、外部ドキュメントが必要かどうかをオンデマンドで決定するために「取得」トークンを発行します。
Self-RAG の「リフレクション トークン」とは何ですか?
IsRelevant、IsSupported、IsUseful などのリフレクション トークンを使用すると、モデルはパッセージとその出力を批評できます。
生成されたステートメントが取得された証拠に基づいているかどうかを評価するリフレクション トークンはどれですか?
IsSupported トークンは、モデルの主張が取得された文章によって実際に裏付けられているかどうかを判断し、幻覚の軽減に役立ちます。
通常、Self-RAG モデルはリフレクション トークンを生成するようにどのようにトレーニングされますか?
Self-RAG は、GPT-4 などのより有能な教師モデルによって頻繁に生成される、リフレクション トークンで注釈が付けられたトレーニング データから学習します。
各パッセージに対して「IsRelevant」批評を行うことにはどのような利点がありますか?
各パッセージの関連性を批判することで、Self-RAG は、主題から外れた検索を答えに詰め込むのではなく、無視することができます。