語言人工智慧指南

HyDE 假設文檔嵌入

HyDE 透過首先要求語言模型想像一個虛假的答案文檔,然後使用該文檔的嵌入而不是原始查詢進行搜尋來改進檢索。

閱讀時間約2分鐘最後更新

概述

It bridges the gap between short questions and the longer passages you actually want to find.

深入探討

HyDE(假設文件嵌入)由高及其同事於 2022 年提出,解決了密集檢索中的問題:簡短的查詢和相關答案段落通常位於嵌入空間的不同區域。食譜分為三個步驟。首先,提示遵循指令的 LLM(如 InstructGPT)產生一個可以回答查詢的假設文檔,即使它包含虛構的或部分不準確的細節。其次,使用無監督對比編碼器(例如 Contriever)嵌入該假設文件。第三,使用該嵌入透過最近鄰搜尋來尋找真實的段落。編碼器充當有損壓縮器,過濾掉法學碩士的捏造,同時保留相關的語意訊號。值得注意的是,HyDE 是零樣本工作,不需要標記相關數據,並且可以在不同語言和任務中匹配或擊敗經過微調的檢索器。

技術洞察

聰明的見解是嵌入步驟是噪音降噪器。儘管產生的文件可能包含事實錯誤,但密集編碼器將其映射到接近真正相關的真實段落,因為它們共享主題和語義模式,而幻覺的細節會在固定大小向量的瓶頸中被沖掉。 HyDE 將訓練查詢編碼器的負擔轉移到利用法學碩士的生成知識以及現成的無監督嵌入器。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

HyDE 假設文檔嵌入的未來

HyDE 是高級 RAG 管道中的構建塊,通常與重新排序和多查詢生成相結合。期望產生多個假設文件並平均其嵌入以實現魯棒性的變體,僅在原始查詢檢索不佳時觸發 HyDE 的自適應使用,以及與更便宜的本地 LLM 更緊密的集成以減少延遲和成本。隨著生成模型的改進,假設文件的品質以及檢索的品質應該不斷提高。

現實世界的實施

在不存在標記查詢通道訓練資料的新領域中進行零樣本檢索

多語言搜索,在嵌入之前用目標語言產生假設答案

透過將簡潔的使用者問題擴展為豐富的偽文檔來提高 RAG 召回率

研究和法律搜索,其中簡短的查詢需要匹配密集、行話較多的源段落

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HyDE Hypothetical Document Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

FastText 子詞嵌入

常見問題

What is HyDE Hypothetical Document Embeddings?

HyDE 透過首先要求語言模型想像一個虛假的答案文檔,然後使用該文檔的嵌入而不是原始查詢進行搜尋來改進檢索。它彌合了短問題和您實際想要查找的較長段落之間的差距。

HyDE 在執行檢索之前會產生什麼?

HyDE 提示法學碩士撰寫假設的答案文檔,然後使用其嵌入來搜尋真實的段落。

為什麼假設的文件包含事實錯誤並不重要?

固定大小的嵌入充當有損瓶頸,捕捉主題相關性,同時丟棄幻覺的細節。

原始 HyDE 中使用哪種類型的嵌入模型來對假設文檔進行編碼?

HyDE 將 LLM 產生器與無監督對比編碼器(如 Contriever)配對以嵌入假設文件。

HyDE 旨在解決密集檢索中的哪些核心問題?

透過將查詢轉換為類似文件的文本,HyDE 使搜尋向量更接近其應匹配的段落類型。