語言人工智慧指南

ALiBi 位置偏差

ALiBi(帶有線性偏差的注意力)是一種巧妙的方法,可以為 Transformer 提供詞序感,而無需傳統的位置嵌入。

閱讀時間約2分鐘最後更新

概述

It lets a model trained on short text handle much longer inputs at inference time.

深入探討

Transformer 沒有內建的詞序概念,因此它們需要一種對位置進行編碼的方法。經典方法將位置嵌入添加到標記向量中。 Press、Smith 和 Lewis 在 2021 年推出的 ALiBi 完全拋棄了這些。相反,它直接推動注意力分數:當查詢標記查看關鍵標記時,ALiBi 會減去與它們之間的距離成比例的懲罰。相距較遠的標記會受到更大的懲罰,因此模型自然更喜歡附近的上下文。每個注意力頭都有自己固定的懲罰斜率,所以有些頭看局部,而有些頭看得更遠。由於偏差只是距離的函數,ALiBi 可以優雅地推斷出比訓練中看到的序列長得多的序列。

技術洞察

對於位置 i 處的查詢和位置 j 處的鍵,ALiBi 在 softmax 之前將 m * (j - i) 加到原始注意力分數,其中 m 是頭部特定常數(斜率形成幾何序列,如 1/2、1/4、1/8)。由於因果注意力中 j 小於或等於 i,因此該項為零或負數,從而懲罰遠處的標記。沒有學習參數,也沒有添加嵌入,因此唯一的開銷是預先計算的偏差矩陣。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

ALiBi 部位偏差的未來

ALiBi 證明了相對的、基於距離的偏差在長度泛化方面擊敗了絕對位置嵌入,而這個想法現在滲透到了現代的長上下文設計中。最近的一些模型更傾向於旋轉嵌入 (RoPE),但 ALiBi 在極端外推很重要的情況下仍然很受歡迎,並被用於 BLOOM 和 MPT 等模型中。隨著實驗室將上下文視窗推向數百萬個令牌,而無需從頭開始重新訓練,預計將繼續進行混合實驗,將距離偏差與 RoPE 縮放相結合。

現實世界的實施

依靠 ALiBi 的推斷,在 1,024 個令牌範例上訓練聊天機器人,但將其部署在 4,096 個令牌文件上,無需重新訓練。

BLOOM 176B 多語言模型,採用 ALiBi 進行部位處理。

MosaicML 的 MPT 模型,使用 ALiBi 在推理時有效地宣傳無限的上下文長度。

總結超出模型原始訓練長度的長期法律合同,其中鄰近上下文偏差使注意力保持一致。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

用於上下文擴展的位置插值

常見問題

What is ALiBi Position Bias?

ALiBi(帶有線性偏差的注意力)是一種巧妙的方法,可以為 Transformer 提供詞序感,而無需傳統的位置嵌入。它允許在短文本上訓練的模型在推理時處理更長的輸入。

ALiBi 代表什麼?

ALiBi 是 Attention with Linear Biases 的縮寫,因其添加到註意力分數中的線性懲罰而得名。

ALiBi如何懲罰遠程代幣?

ALiBi 從注意力分數中減去與查詢鍵距離成比例的值,因此距離越遠的標記權重越小。

ALiBi最著名的實際優勢是什麼?

由於偏差僅取決於距離,因此在短序列上訓練的模型可以在推理時處理更長的序列。

注意力頭之間的線性偏差有什麼不同?

ALiBi 為每個頭分配一個不同的固定斜率(例如 1/2、1/4、1/8),因此不同的頭部參與不同的範圍。

與傳統的位置嵌入相比,ALiBi 增加了多少學習參數?

ALiBi 沒有引入新的學習參數;人均斜率是預先決定的常數。