技術指南

長上下文的位置插值

位置插值 (PI) 是一種簡單、有影響力的技術,它透過將新的位置索引壓縮到模型已知的範圍內來擴展 Transformer 的上下文視窗。

閱讀時間約2分鐘最後更新

概述

Instead of extrapolating to unseen positions, it interpolates within trained ones, requiring only brief fine-tuning.

深入探討

位置插值由 Meta 研究人員(Chen 等人)於 2023 年推出,解決了使用 RoPE 的模型在外推到訓練之外的位置時會發生災難性失敗的事實。這種見解是違反直覺的:PI 不是要求模型處理它從未見過的更大的位置值,而是將傳入的位置索引除以比例因子,以便將 8K 的目標長度映射回原始的 2K 範圍。由於模型是在該範圍內進行訓練的,因此旋轉保持分佈狀態。僅經過 1,000 個微調步驟,LLaMA 模型就以這種方式擴展,可處理多達 32K 的上下文。該論文表明,外推法可以將注意力分數提高到巨大的值,而插值法可以使注意力分數保持有界和穩定,這就是為什麼插值法比外推法效果好得多。

技術洞察

PI 將位置 m 重新調整為 m/s,其中 s 是擴展因子(例如,新長度除以原始長度)。對於 RoPE,這有效地縮小了相鄰位置之間的旋轉步長,將更多位置打包到訓練的角度範圍內。論文中的理論界限顯示插值注意力分數保持良好控制,而樸素外推法可以產生比訓練中看到的分數大幾個數量級的分數,從而破壞了 softmax 的穩定性。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

長上下文位置內插的未來

位置插值成為一系列後續產品的基礎,包括 NTK 感知縮放和 YaRN,它們更有選擇性地進行插值以保留局部細節。發展軌跡是需要很少或不需要微調的方法,以及將長上下文處理融入預訓練中。 PI remains a valuable baseline and is often combined with newer frequency-aware schemes to reach 128K-plus context windows efficiently.

現實世界的實施

透過大約 1,000 個微調步驟擴展 2K 上下文 LLaMA 模型以處理 8K-32K 令牌

調整現有的聊天模型以進行長文件摘要,而無需從頭開始重新訓練

作為 NTK 感知擴展和 YaRN 改進的概念基線

對最初使用短視窗訓練的模型啟用長上下文程式碼或法律文件分析

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Positional Interpolation for Long Context quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

用於上下文擴展的位置插值

常見問題

What is Positional Interpolation for Long Context?

位置插值 (PI) 是一種簡單、有影響力的技術,它透過將新的位置索引壓縮到模型已知的範圍內來擴展 Transformer 的上下文視窗。它不是推斷到看不見的位置,而是在經過訓練的位置內進行插值,只需要進行簡短的微調。

位置插值背後的核心思想是什麼?

PI 將位置索引除以比例因子,以便較長的序列對應回訓練的位置範圍,從而保持旋轉分佈。

為什麼對更長頭寸的天真推斷會失敗?

PI 論文表明,看不見的大位置可以產生比訓練大幾個數量級的注意力分數,從而破壞 softmax 的穩定性。

原始 PI 工作大約需要多少微調才能將 LLaMA 擴展到 32K?

該論文報告稱,大約 1,000 個微調步驟足以將上下文擴展到 32K 個標記。

如果將上下文擴展一個因子 s,那麼 PI 如何變換位置 m?

PI 將位置 m 重新調整為 m/s,將新的較大範圍壓縮到原始訓練範圍。

PI 如何影響後來的方法(例如 YaRN)?

PI 將插值確定為安全方法; NTK 感知縮放和 YaRN 透過更有選擇性地插值頻率來改進它。