語言人工智慧指南

用於上下文擴展的位置插值

位置插值 (PI) 是一種透過重新縮放位置索引而不是外推位置索引來將語言模型的可用上下文視窗延伸到遠遠超出其訓練長度的技術。

閱讀時間約2分鐘最後更新

概述

它讓一個以 2K 或 4K 代幣訓練的模型,只需輕微微調就能處理 32K 或更多。

深入探討

大多數現代法學碩士都使用旋轉位置嵌入(RoPE),它將位置編碼為應用於查詢和鍵向量的旋轉角度。如果你只是輸入更長的序列,模型會看到它從未訓練過的位置和旋轉角度,並且性能會崩潰,因為注意力很難推斷範圍之外的頻率。位置插值避免了外推:為了從長度 L 延伸到長度 L',它將每個位置索引除以因子 L'/L,將新範圍壓縮回訓練區間。模型現在只能看到分佈角度,只是間隔更密集。短暫的微調(通常是幾百到一千步)可以讓它適應更精細的間距,以預訓練成本的一小部分產生穩定的長情境行為。

技術洞察

RoPE 以從細到粗的頻率旋轉尺寸對。 PI 將位置 m 重新調整為 m/s,其中 s = L'/L,因此旋轉角度保持在訓練範圍內而不是外推。 NTK 感知縮放和 YaRN 等頻率感知變體更進一步:它們更少地縮放低頻,更多地縮放高頻(或按波長插值),保留高頻局部細節,同時擴展低頻長距離範圍。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

上下文擴展位置插值的未來

上下文擴展正在快速發展。 NTK 感知的 RoPE 縮放、YaRN 和動態/長 RoPE 等方法現在將視窗推向數十萬甚至數百萬個令牌,有時幾乎不需要微調。預計這些擴展技巧將與高效的注意力和 KV 快取壓縮相結合,並成為模型配置中的標準旋鈕。研究仍在繼續,以便在整個視窗中保持較高的準確性,以便上下文真正可用,而不僅僅是名義上支援。

現實世界的實施

將 4K 訓練的 LLaMA 模型擴展到 32K 上下文,以在短暫微調後總結長文件。

將整個程式碼庫或大型法律合約載入到一個提示中以進行跨文件問答。

使用 NTK 感知或 YaRN 縮放來延長上下文,只需最少或無需額外培訓。

透過在推理時重新調整 RoPE 位置,提供長聊天歷史記錄而不會被截斷。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Position Interpolation for Context Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

YaRN 和上下文長度擴展

常見問題

什麼是用於上下文延伸的位置插值?

位置插值 (PI) 是一種透過重新縮放位置索引而不是外推位置索引來將語言模型的可用上下文視窗延伸到遠遠超出其訓練長度的技術。它讓在 2K 或 4K 令牌上訓練的模型只需進行輕微微調即可處理 32K 或更多。

位置插值的核心思想是什么?

PI 將位置索引除以擴展因子,將較長的序列對應回模型已學習的分佈範圍。

位置內插與哪一種位置編碼方案最相關?

PI 在基於 RoPE 的模型中普及,可以重新調整旋轉角度,使其保持在訓練頻率內。

為什麼對更長上下文的天真推斷往往會失敗?

輸入較長的序列會使模型暴露在從未訓練過的範圍之外的角度,導致注意力和表現急劇下降。

如果將上下文長度從 L 擴展到 L',基本 PI 將什麼重新縮放因子應用於位置 m?

PI 將 m 對應到 m 除以因子 s = L'/L,將較長範圍壓縮到原始訓練區間。

NTK 感知縮放和 YaRN 如何改善普通位置插值?

這些方法以不同的方式縮放低頻和高頻,保留細粒度的局部位置細節,同時仍達到更長的上下文。