語言人工智慧指南

迷失在中間效應

「迷失在中間」效應是指語言模型傾向於在長輸入的開頭或結尾時最好地使用訊息,而忽略埋藏在中間的事實。

閱讀時間約2分鐘最後更新

概述

It matters because it limits how much we can trust long-context models with retrieved documents.

深入探討

史丹佛大學的劉和同事在 2023 年進行的一項研究中發現,當向模型提供許多文件並要求模型使用包含關鍵事實的文件來回答時,就會出現這種效應。準確度形成了一條 U 形曲線:當相關段落位於提示的開頭或結尾時,準確度最高,而當相關段落位於中間時,準確度明顯較低。即使是標榜具有長上下文能力的模型也是如此。對於檢索增強生成來說,這意味著很明顯:將數十個段落塞進提示中並不能保證模型均勻地讀取它們。位置,而不僅僅是存在,決定了模型是否關注事實。這項工作將長上下文重新定義為有效使用的問題,而不是原始視窗大小的問題。

技術洞察

U 型曲線可能源自於注意力和位置編碼如何分配焦點。首要性和新近度偏差部分繼承自訓練資料結構和位置方案,給予早期和晚期標記額外的權重。一些解碼器架構也會透過層強烈傳播早期令牌資訊。最終結果是中間位置受到的關注被稀釋,因此即使完全存在於上下文中,放置在那裡的正確答案也可能被有效地忽略。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

迷失在中間效應的未來

研究人員正在透過注意力調整、位置感知訓練和更聰明的檢索來解決這種影響,這些檢索將最相關的段落重新排列到提示的邊緣。評估套件現在包括跨職位的「大海撈針」測試,以衡量有效的背景。隨著架構的改進,U 曲線正在變平,但從業者將繼續設計管道,將關鍵證據放置在模型實際看起來的地方,而不是相信統一的注意力。

現實世界的實施

RAG 系統檢索 20 個文檔,但錯過了答案,因為它落在 20 個文檔中的第 10 個段落中。

工程師對搜尋結果進行重新排序,將最相關的區塊放在提示的前面或最後。

長文檔摘要者會低估合約中出現的關鍵細節。

「大海撈針」基準隱藏了不同深度的事實,以繪製模型的位置精度圖表。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lost in the Middle Effect quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

音效產生器

常見問題

What is Lost in the Middle Effect?

「迷失在中間」效應是指語言模型傾向於在長輸入的開頭或結尾時最好地使用訊息,而忽略埋藏在中間的事實。這很重要,因為它限制了我們對檢索到的文件的長上下文模型的信任程度。

當關鍵事實在長提示中移動時,準確度會呈現什麼形狀?

當相關資訊接近開頭或結尾並在中間下降並形成 U 形時,準確性最高。

中間迷失效應對於檢索增強生成意味著什麼?

僅僅包含一段文字是不夠的。它在提示中的位置會改變模型使用它的可能性。

哪些偏見被認為會導致這種效應?

對第一個和最後一個位置的額外關注,與位置編碼和訓練結構相關,產生了 U 曲線。

長上下文模型會自動避免這種影響嗎?

研究發現,在作為長上下文銷售的模型中存在這種效應,表明窗口大小並不能確保統一使用。

哪些實際步驟有助於抵消管道中的影響?

將最相關的證據放在開頭或結尾附近,使其與模型最強烈參與的位置一致。