言語AIガイド

HyDE の仮想ドキュメントの埋め込み

HyDE は、最初に言語モデルに偽の回答ドキュメントを想像するよう依頼し、次に生のクエリの代わりにそのドキュメントの埋め込みを使用して検索することにより、検索を向上させます。

2分の読書最終更新日

概要

It bridges the gap between short questions and the longer passages you actually want to find.

ディープダイブ

Gao らによって 2022 年に提案された HyDE (Hypothetical Document Embeddings) は、高密度検索の問題に取り組んでいます。短いクエリと関連する回答の一節は、多くの場合、埋め込み空間の異なる領域に存在します。レシピには3つのステップがあります。まず、命令に従う LLM (InstructGPT など) に、たとえ創作された詳細や部分的に不正確な詳細が含まれている場合でも、クエリに答える仮説的なドキュメントを生成するように指示します。 2 番目に、教師なしのコントラスト エンコーダ (Contriever など) を使用してその仮説ドキュメントを埋め込みます。 3 番目に、その埋め込みを使用して、最近傍検索によって実際のパッセージを見つけます。エンコーダは非可逆圧縮器として機能し、関連するセマンティック信号を維持しながら LLM の加工をフィルタリングして除去します。注目すべきことに、HyDE はゼロショットで機能し、ラベル付きの関連性データは必要なく、言語やタスクを超えて微調整された検索ツールと同等かそれを上回ります。

技術的な洞察

賢明な洞察は、埋め込みステップがノイズの多いノイズ除去であるということです。生成された文書に事実上の誤りが含まれている可能性がある場合でも、高密度エンコーダーは、トピックと意味のパターンを共有するため、真に関連する実際の文章の近くに文書をマッピングしますが、幻覚の詳細は固定サイズのベクトルのボトルネックで洗い流されます。 HyDE は、クエリ エンコーダーのトレーニングから、LLM の生成知識と既製の教師なしエンベダーの活用に負担を移します。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

HyDE の仮想ドキュメント埋め込みの将来

HyDE は高度な RAG パイプラインの構成要素であり、多くの場合、再ランキングやマルチクエリ生成と組み合わされます。複数の仮想ドキュメントを生成し、その埋め込みを平均して堅牢性を高めるバリアント、生のクエリの取得が不十分な場合にのみ HyDE をトリガーする適応的な使用、およびレイテンシとコストを削減するための安価なローカル LLM との緊密な統合が期待されます。生成モデルが改善されるにつれて、仮説ドキュメントの品質、ひいては検索の品質も向上し続けるはずです。

現実世界の実装

ラベル付きクエリパッセージトレーニングデータが存在しない新しいドメインでのゼロショット取得

多言語検索。埋め込む前にターゲット言語で仮説的な回答を生成します。

ユーザーの簡潔な質問を豊富な疑似ドキュメントに拡張することで、RAG の再現率を向上させます

短いクエリが高密度で専門用語の多いソース文章と一致する必要がある研究および法律検索

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HyDE Hypothetical Document Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

FastText サブワード埋め込み

よくある質問

What is HyDE Hypothetical Document Embeddings?

HyDE は、最初に言語モデルに偽の回答ドキュメントを想像するよう依頼し、次に生のクエリの代わりにそのドキュメントの埋め込みを使用して検索することにより、検索を向上させます。短い質問と実際に見つけたい長い文章の間のギャップを埋めます。

HyDE は取得を実行する前に何を生成しますか?

HyDE は、LLM に仮説的な回答ドキュメントを作成するよう促します。その後、その埋め込みが実際のパッセージの検索に使用されます。

仮定の文書に事実上の誤りが含まれていても、なぜそれほど問題にならないのでしょうか?

固定サイズの埋め込みは、幻覚の詳細を破棄しながら、話題の関連性を捕捉する損失の多いボトルネックとして機能します。

元の HyDE では、仮説ドキュメントをエンコードするためにどのタイプの埋め込みモデルが使用されていますか?

HyDE は、LLM ジェネレーターと Contriever のような教師なしコントラスト エンコーダーを組み合わせて、仮説的なドキュメントを埋め込みます。

HyDE は高密度検索におけるどのような中心的な問題に対処するように設計されていますか?

HyDE は、クエリをドキュメントのようなテキストに変換することにより、検索ベクトルを一致すべき種類の文章に近づけます。