YaRN 上下文視窗縮放
YaRN(另一個 RoPE 擴展)是一種將 Transformer 的可用上下文視窗延伸到遠遠超出其訓練範圍的技術,只需進行最少的微調。
概述
It matters because it lets existing models handle much longer documents without retraining from scratch.
深入探討
大多數現代法學碩士都使用旋轉位置嵌入 (RoPE) 來編碼單字位置,這種方法只能在模型訓練期間看到的長度內有效。輸入較長的序列,模型會嚴重退化。 YaRN 透過以頻率感知的方式重新調整 RoPE 的旋轉頻率來解決這個問題:高頻維度(捕獲本地、附近的關係)大部分保持不變,而低頻維度(捕獲遠端位置)則進行插值。它還增加了注意力的溫度調節,以保持邏輯在遠距離表現良好。結果在 LLaMA 模型上得到了證明,僅使用約 0.1% 的原始訓練資料和數百個微調步驟,即可將上下文從 4K 擴展到 64K-128K 令牌。
技術洞察
RoPE 將查詢向量和鍵向量旋轉與位置和每維度頻率成比例的角度。樸素的線性內插(位置內插)會同等地壓縮所有頻率,進而損害局部細節。 YaRN 則相反地應用「NTK-by-parts」:它僅對低頻(長波長)維度進行插值,單獨保留高頻維度,並在它們之間進行斜坡。注意力溫度的縮放可以補償熵位移,從而在擴展長度下保持準確性。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
YaRN 上下文視窗縮放的未來
YaRN 風格的頻率感知擴展已成為發布長上下文模型的預設成分;隨著實驗室向百萬代幣窗口推進,變體和後繼者不斷出現。期望與高效關注、KV 快取壓縮和根據請求動態調整的動態擴展進行更緊密的整合。更廣泛的趨勢是將「模型訓練多長時間」與「模型可以有效讀取多長時間」脫鉤,使長上下文成為廉價的訓練後功能,而不是昂貴的架構承諾。
現實世界的實施
將開放的 LLaMA 模型從 4K 擴展到 128K 代幣,以便它可以一次攝取整個程式碼庫或長合約
讓聊天機器人保留很長的對話歷史記錄,而不會截斷先前的對話
總結超出基本模型本機視窗的書本長度文件或多小時轉錄本
僅使用少量微調運行即可廉價地調整預訓練模型以執行長上下文檢索任務
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is YaRN Context Window Scaling?
YaRN(另一個 RoPE 擴展)是一種將 Transformer 的可用上下文視窗延伸到遠遠超出其訓練範圍的技術,只需進行最少的微調。這很重要,因為它可以讓現有模型處理更長的文檔,而無需從頭開始重新訓練。
YaRN 修改了什麼位置編碼方案來擴展上下文長度?
YaRN 代表“另一個 RoPE 擴展”,透過重新調整旋轉位置嵌入中使用的旋轉頻率來工作。
YaRN 如何處理高頻與低頻 RoPE 維度?
YaRN 的「NTK-by-parts」方法保留高頻(局部)維度,同時插入低頻(遠端)維度以避免損害局部細節。
與從頭開始訓練長上下文模型相比,YaRN 的關鍵效率優勢是什麼?
YaRN 可以使用大約 0.1% 的原始訓練資料和少量的微調步驟來擴展上下文,比重新訓練便宜得多。
除了重新調整頻率之外,YaRN 還應用哪些額外調整來維持遠端注意力穩定?
YaRN 修改注意力溫度以補償當序列變得更長時發生的熵/logit 偏移。
如果您輸入的 RoPE 模型序列遠長於訓練時的序列,且沒有任何縮放,會出現什麼問題?
RoPE 對於看不見的多頭部位的泛化能力很差,因此除非重新調整頻率,否則品質會崩潰。