密集した通路の検索
Dense Passage Retrieval (DPR) は、単語の一致ではなく、質問とパッセージの意味を数値ベクトルとして比較することにより、関連するテキストを見つけます。
概要
It matters because it can retrieve correct answers even when the query and the document share zero vocabulary.
ディープダイブ
2020 年に Facebook AI によって導入された DPR は、質問エンコーダーとパッセージ エンコーダーという 2 つの別個の BERT エンコーダーを使用します。それぞれがテキストを固定長の密ベクトル (多くの場合 768 次元) に変換します。関連性は質問ベクトルとパッセージベクトルの間のドット積であるため、検索は事前に計算されたパッセージ埋め込みに対する高速最近傍検索になります。このモデルは、バッチ内のネガと BM25 からマイニングされたハード ネガを使用して、正しい文章のベクトルを質問に近づけ、間違ったベクトルを遠ざけるという対照的な目的でトレーニングされています。 Natural Queues のようなオープンドメインの QA ベンチマークでは、DPR が長らく優勢だった BM25 を大差で破り、学習されたセマンティック マッチングが質問に答えるためのキーワード検索よりも優れたパフォーマンスを発揮できることを示しました。
技術的な洞察
DPR はバイエンコーダです。クエリと各パッセージを独立してエンコードするため、すべてのパッセージ ベクトルが 1 回計算され、ベクトル インデックス (FAISS など) に保存されます。クエリ時には質問をエンコードするだけで、次に近似最近傍検索を実行します。トレーニングはバッチ内のネガティブに依存します。同じミニバッチ内の他のパッセージはほぼ無償でネガティブ サンプルとして機能し、1 つのポジティブ ペアで多くの対照的な比較を効率的に生成できます。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
密な通路検索の未来
現在、高密度検索は、大規模な言語モデルを供給するほとんどの検索拡張生成パイプラインを支えています。研究は、高密度スコアと語彙スコアを融合するハイブリッド システム、より詳細なマッチングのためにトークンごとのベクトルを保持する ColBERT のような遅延インタラクション モデル、および多くのタスクに適応する命令調整された埋め込みを目指して進んでいます。より安価で、多言語に対応し、より長いコンテキストのエンコーダーに加えて、それらが提供するジェネレーターとレトリーバーのより緊密な共同トレーニングが期待されます。
現実世界の実装
LLM が回答を作成する前に、サポートする Wikipedia の文章を取得するオープンドメインの質問応答システム
従業員が自然な質問をし、正確なキーワードがなくても関連する段落を取得できるエンタープライズ文書検索
言い換えられた苦情から適切なヘルプセンター記事を取得するカスタマー サポート ボット
検索機能を強化したチャットボットにより、プライベートの知識ベースに回答を基にして幻覚を軽減します
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dense Passage Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
ColBERT 遅延インタラクションの取得
よくある質問
What is Dense Passage Retrieval?
Dense Passage Retrieval (DPR) は、単語の一致ではなく、質問とパッセージの意味を数値ベクトルとして比較することにより、関連するテキストを見つけます。クエリとドキュメントの共通語彙がゼロであっても、正しい答えを取得できるため、これは重要です。
密な通路の検索の背後にある中心的なアイデアは何ですか?
DPR は、クエリとパッセージの両方を密なベクトルにマッピングし、それらの類似性 (ドット積) によって関連性を測定し、単語の重複ではなく意味を捉えます。
DPR は「バイエンコーダー」アーキテクチャを使用します。それはどういう意味ですか?
バイエンコーダーには質問とパッセージに独立したエンコーダーがあるため、パッセージベクトルを事前に計算してインデックスを付けることができます。
DPR ではなぜ事前に通過ベクトルを計算できるのでしょうか?
パッセージエンコーダはクエリに依存しないため、すべてのパッセージ埋め込みを事前に計算して保存し、検索時にエンコードするクエリのみを残すことができます。
DPR が多くの否定的な例を安価に生成できるようにするトレーニングのトリックは何ですか?
バッチ内ネガティブは、ミニバッチ内の他のパッセージを特定の質問に対するネガティブとして扱い、多くの対照的なペアを効率的に生成します。
DPR の最近傍検索を大規模に高速化するために一般的に使用されるツールは何ですか?
FAISS のようなベクトル インデックスは、事前に計算された何百万ものパッセージ埋め込みに対して高速な近似最近傍検索を実行します。