YaRN 和上下文長度擴展
YaRN(另一種 RoPE 擴展)是一種有效的技術,可以將模型的可用上下文視窗擴展到遠遠超出其訓練範圍的範圍。
概述
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
深入探討
大多數現代法學碩士都使用 RoPE(旋轉位置嵌入)對令牌位置進行編碼,它按與位置相關的角度旋轉查詢和鍵向量。當您輸入的序列比訓練長度長時,這些旋轉會進入看不見的範圍,並且模型會崩潰。 YaRN 由 Bowen Peng 及其合作者於 2023 年推出,透過按頻率應用 NTK 感知插值來修復此問題:它使高頻維度(捕獲本地、短程關係)基本保持不變,同時插值低頻維度(追蹤遠端位置)。 YaRN 還為注意力添加了溫度調整,以應對來自較長上下文的熵變化。僅對樸素方法所需的一小部分數據和步驟進行微調後,結果是強大的長上下文性能。
技術洞察
RoPE 為每個嵌入維度分配一個旋轉頻率。樸素的線性插值同等地壓縮所有頻率,損害了編碼精細局部細節的高頻維度。 YaRN 使用斜坡函數僅對低頻(長波長)維度進行插值,同時保留高頻維度,再加上 1/sqrt(t) 注意力溫度縮放,可隨著序列長度的增長保持 softmax 銳度穩定。這種按部分 NTK 的方法擴展了上下文,並且降級少得多。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
YaRN 和上下文長度擴展的未來
上下文擴展現在已成為標準做法:開放模型通常會提供達到 128K 令牌或更多的 YaRN 擴展變體。研究正在轉向透過零或接近零微調來擴展上下文、將 RoPE 重新縮放與注意力模式技巧相結合、並在整個窗口(而不僅僅是兩端)保持品質的方法。預計這些技術會更緊密地整合到預訓練中,因為長上下文是原生的而不是改造的。
現實世界的實施
透過簡單的微調將開放的 4K 上下文模型擴展到 32K 或 128K,以進行長文檔問答
使檢索增強系統能夠攝取許多串聯的段落而不被截斷
為需要整個大型儲存庫文件或一次提示中的多個文件的程式碼助手提供支持
針對累積大量聊天歷史的長時間多輪對話調整基本模型
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is YaRN and Context Length Extension?
YaRN(另一種 RoPE 擴展)是一種有效的技術,可以將模型的可用上下文視窗擴展到遠遠超出其訓練範圍的範圍。它巧妙地重新縮放旋轉位置嵌入,因此在 4K 令牌上訓練的模型可以透過最少的微調處理 32K 或更多。
YaRN 修改了什麼位置編碼方法來擴展上下文?
YaRN,其名字的意思是“另一個 RoPE 擴展”,它重新調整了大多數現代法學碩士中使用的旋轉位置嵌入。
當 RoPE 模型看到的序列比其訓練長度長時,會出現什麼問題?
超出訓練的位置會產生模型從未見過的旋轉角度,因此註意力行為會急劇下降。
YaRN 如何處理不同的 RoPE 頻率維度?
YaRN 使用 NTK 分段斜坡來插入長波長低頻調光,並讓短程高頻調光基本上保持不變。
除了重新調整頻率之外,YaRN 還應用了哪些額外調整?
YaRN 為注意力邏輯添加了溫度縮放,以抵消隨著上下文增長而發生的熵變化。
與樸素插值相比,YaRN 的關鍵實際優勢是什麼?
在對一小部分原始方法所需的數據進行微調後,YaRN 實現了強大的長上下文品質。