推測性 RAG 和檢索增強起草
推測性 RAG 透過讓一個小型、快速的模型從檢索到的文件中起草多個候選答案,然後由更大的模型進行驗證,來加速和銳化檢索增強的生成。
概述
It matters because it cuts latency and reduces the confusion large models suffer when stuffed with many long passages.
深入探討
經典 RAG 將所有檢索到的文件輸入到一個大語言模型中,這種模型速度很慢,並且當上下文很長時容易失去焦點。投機性的 RAG 會分割工作。一個較小的、專門的「起草者」模型會獲得檢索到的文檔簇,並並行產生多個候選答案,每個答案都基於不同的證據子集並附有理由。然後,一個更大的「驗證者」模型對這些草稿進行評分並選擇最好的一份,而不是自行閱讀所有文件。由於小模型處理繁重的閱讀,而大模型僅判斷短稿,因此系統速度更快,而且通常更準確。聚類步驟確保草稿涵蓋不同的觀點,而不是冗餘的段落。
技術洞察
檢索到的文件根據內容相似性進行聚類,然後從每個聚類中採樣一個文件以形成不同的、非冗餘的子集。輕量級起草者並行產生一個答案以及每個子集的基本原理。驗證者透過結合草稿的自洽性、理由的條件機率和自我反思訊號來計算置信度分數,然後選擇得分最高的草稿。這種分工反映了推測性解碼:廉價的並行提案,一項權威檢查。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
推測性 RAG 和檢索增強起草的未來
推測性 RAG 指向模組化檢索系統,其中小型蒸餾起草器按域進行調整,並在共享驗證器後面進行交換。期望與代理管道、基於問題難度的自適應草稿數量以及也標記證據不足的驗證器進行更緊密的整合。隨著上下文視窗的增長,價值從塞入更多文本轉變為智慧地並行化證據推理,使得起草和驗證架構成為紮根問答的預設架構。
現實世界的實施
醫療問答助理,小型起草者並行閱讀集群臨床指南,大型模型驗證最安全、最受支持的答案。
一個企業搜尋機器人,可以從不同的文件叢集中起草多個候選答案,以減少長知識庫上的回應延遲。
一種法律研究工具,根據不同的判例法子集產生相互競爭的解釋,然後用驗證者模型對它們進行排名。
客戶支援系統提煉出特定領域的起草者來處理產品手冊,而通用驗證者則確保事實依據。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative RAG and Retrieval-Augmented Drafting quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Speculative RAG and Retrieval-Augmented Drafting?
推測性 RAG 透過讓一個小型、快速的模型從檢索到的文件中起草多個候選答案,然後由更大的模型進行驗證,來加速和銳化檢索增強的生成。這很重要,因為它可以減少延遲並減少大型模型在填充許多長段落時所遭受的混亂。
在 Speculative RAG 中,較小的模型扮演什麼角色?
輕量級「起草者」讀取聚集的文檔子集並並行產生幾個有根據的候選答案。
為什麼檢索到的文件在起草前會聚集在一起?
對每個簇的一份文件進行聚類和採樣,為每份草稿提供了獨特的、不重疊的證據片段,鼓勵多樣化的答案。
更大的「驗證者」模型主要做什麼?
驗證者不是親自閱讀所有文檔,而是評估簡短的草稿和基本原理,並選擇得分最高的答案。
與標準 RAG 相比,推測 RAG 如何減少延遲?
昂貴的大型模型不再攝取所有長段落;它只驗證簡短的草稿,而並行起草則負責閱讀。
推測性 RAG 的「先草稿後驗證」結構在概念上類似於哪種解碼技術?
兩者都使用來自小模型的廉價並行提案,然後來自較大模型的權威檢查。