テクニカルガイド
検索用の埋め込みモデルの微調整
埋め込みモデルを微調整するということは、実際のクエリとそれに答えるドキュメントのペアでモデルをトレーニングし、ドメイン内で関連性のあるテキストが無関係なテキストよりもベクトル空間で近くに配置されるようにすることを意味します。
概要
検索の品質が RAG の品質を制限するため、これは重要です。適切なパッセージが検索されない場合、言語モデルはそれを使用できません。また、汎用の埋め込みでは、ドメインの語彙、略語、およびユーザーの質問の表現方法が見逃されることがよくあります。
ディープダイブ
埋め込みモデルはテキストをベクトルに変換するため、意味的に類似したテキストは、通常はコサイン類似度によって測定される類似したベクトルを持つようになります。 RAG では、クエリとドキュメント チャンクの両方が埋め込まれ、最も近いチャンクが取得されます。一般的なモデルは、ブロードウェブと質問と回答のデータでトレーニングされます。これらはどこでもある程度うまく機能しますが、専門用語、社内製品名、ユーザーの質問方法とドキュメントの書き方とのギャップに苦戦する可能性があります。微調整により、3 つの形式のトレーニング データとのギャップが埋められます。ポジティブペアは、クエリとそれに答える文章です。バッチ内ネガティブでは、スコアを低くすべきものの例として、同じトレーニング バッチ内の他のパッセージが使用されます。厳密な否定文は、関連性があり、単語やトピックを共有しているように見えますが、質問には答えていない文章です。イージー ネガはベース モデルによってすでに分離されているため、ハード ネガは最も重要な細かい区別を教えます。優れたデータ ソースには、クリック数を含む検索ログ、記事にリンクされたサポート チケット、FAQ ページ、言語モデルによってドキュメントから生成された合成クエリなどが含まれます。合成データは便利ですが、生成された質問は文書の文言をコピーすることが多く、タスクが簡単になりすぎるため、フィルタリングする必要があります。よくある誤解は、微調整が不十分な検索に対する最初の修正であるということです。多くの場合、チャンク化を改善したり、ハイブリッド セットアップで BM25 などのキーワード検索を追加したり、リランカーを追加したりすると、少ない労力で大きな成果が得られます。微調整が最も価値があるのは、取得ギャップを測定し、少なくとも数千の高品質ペアを構築できるか、構築できる場合です。もう 1 つの落とし穴は偽陰性です。つまり、実際にクエリに応答するマイニングされたハード ネガティブです。モデルをトレーニングして押しのけると、品質が損なわれます。また、古いベクトルと新しいベクトルは比較できないため、埋め込みモデルを変更するにはドキュメント コレクション全体を再埋め込む必要があることにも注意してください。
戦略的影響
費用と予算
アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。
より明確な判決
技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。
品質管理
より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。
検索のための埋め込みモデルの微調整の将来
一般的な埋め込みモデルは、MTEB などのパブリック ベンチマークで改善を続けています。ベンチマーク データがプライベート コーパスと一致することはほとんどないため、領域適応の利点は狭められますが、取り除かれるわけではありません。言語モデルを使用した合成データ生成により、大規模なラベル付きデータセットを持たないチームでも微調整が実用的になりました。微調整された埋め込みモデルが第 1 段階のリコールを処理し、リランカーが精度を処理するハイブリッド パイプラインの継続的な使用が期待されます。測定の習慣が最も重要です。実際のクエリのリコールを追跡するチームは、微調整がいつ成果を上げるかを知ることができます。
現実世界の実装
保険会社は、顧客の質問とそれに答える保険条項のペアに基づいて埋め込みをトレーニングするため、「携帯電話を落とした場合は補償されますか?」という質問で偶発的損害条項を取得します。
ソフトウェア会社はサポート チケットの履歴を使用し、各チケットの質問と回答にリンクされているヘルプ記事のエージェントを無料のトレーニング データとして組み合わせます。
法律調査チームは、クエリとキーワードを共有しているが、異なる管轄区域に対応している条項を取得することでハード ネガティブをマイニングし、それらを分離するようにモデルに学習させます。
製薬チームは、言語モデルを使用して内部文書から合成質問を生成し、低品質のものを除外し、そのペアを使用してドメイン埋め込みモデルをトレーニングします。
リスクとガードレール
1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。
インフラストラクチャとメンテナンスのコストは過小評価されがちです。
システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。
実装ロードマップ
実装前にレイテンシ、品質、コストの目標を定義します。
現実的な負荷とデータ条件でのベンチマーク。
エラー、ドリフト、ユーザーへの影響を計測器で監視します。
スケーリングの前に、ロールバックとインシデント対応のパスを準備します。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Fine-Tuning Embedding Models for Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
よくある質問
検索用の埋め込みモデルの微調整とは何ですか?
埋め込みモデルを微調整するということは、実際のクエリとそれに答えるドキュメントのペアでモデルをトレーニングし、ドメイン内で関連性のあるテキストが無関係なテキストよりもベクトル空間で近くに配置されるようにすることを意味します。検索の品質が RAG の品質を制限するため、これは重要です。適切なパッセージが検索されない場合、言語モデルはそれを使用できません。また、汎用の埋め込みでは、ドメインの語彙、略語、およびユーザーの質問の表現方法が見逃されることがよくあります。
埋め込み微調整における重大なマイナス要因とは何ですか?
ハード ネガティブは、クエリと単語やトピックを共有していますが、正しくないため、モデルに細かい区別を教えます。
ハード ネガがイージー ネガよりも役立つのはなぜですか?
簡単な否定はすでにクエリから遠く離れています。ハード ネガでは、モデルに微妙な違いを学習させます。
この文脈における偽陰性とは何ですか?
否定的な考えが実際に関連している場合、トレーニングによって正解が遠ざけられ、検索が妨げられます。
クエリとパッセージのペアで埋め込みモデルをトレーニングするために一般的に使用される損失はどれですか?
対照的な損失は、バッチ内およびハード ネガティブに対してプラスのスコアを獲得し、プラスをトップに押し上げます。
新しく微調整された埋め込みモデルに切り替えた後、ドキュメントのインデックスに対して何をする必要がありますか?
異なるモデルのベクトルは比較できないため、コレクション全体を再埋め込む必要があります。
学び続ける
関連ガイド
このトピックのために選ばれたその他のガイド