語言人工智慧指南

前綴調優

前綴調整是一種參數有效的方法,透過訓練一小組連續向量來適應凍結的語言模型,這些連續向量會預先添加到每一層的輸入中。

閱讀時間約2分鐘最後更新

概述

It lets you customize giant models for new tasks while updating less than 1% of parameters.

深入探討

史丹佛大學研究人員李和梁在 2021 年提出的前綴調整可以在不影響其權重的情況下調整預先訓練的變壓器。它不是微調所有參數,而是在每個注意力層的鍵和值前面添加一系列可訓練的「虛擬標記」(前綴)。凍結模型會像處理真實上下文一樣處理此前綴,將其行為引導至目標任務。由於僅學習前綴向量,因此您可以為每個任務儲存一個微小的前綴,而不是完整的模型副本。這使得許多任務的服務成本降低,並避免了完全微調帶來的儲存爆炸。它在表格到文字和摘要等生成任務上表現尤其出色,通常與高數據設定中的完全微調相匹配。

技術洞察

與僅在輸入嵌入層添加向量的提示調整不同,前綴調整將可訓練的鍵/值向量注入每個轉換器層的自註意力中。為了穩定訓練,前綴通常由小型前饋網路(重新參數化技巧)生成,而不是直接優化;該網路在訓練後被丟棄,只留下學習到的前綴矩陣。只有這些前綴參數接收梯度——整個骨幹網路保持凍結狀態。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

前綴調優的未來

前綴調整有助於啟動參數高效微調 (PEFT) 波,並且仍然是 Hugging Face PEFT 等庫中的構建塊。隨著基本車型成長到數千億個參數,像前綴這樣的輕量級適配器對於多租戶服務和設備上的個人化越來越有吸引力。預計將繼續採用混合方法,將前綴與 LoRA 風格的低等級更新相混合,並在控制風格、角色和安全行為方面得到越來越多的使用,而無需重新訓練整個模型。

現實世界的實施

透過在 WebNLG 資料集上訓練一個小前綴,調整一個凍結的 GPT-2 主幹以進行表格到文字的生成

從單一共享模型提供數十種特定於客戶的摘要樣式,每個樣式都作為可交換的前綴文件

在不重新訓練基本權重的情況下控制聊天機器人的語言模型的語氣或角色

低數據域適應,例如法律或醫學文本生成,完全微調會過度擬合

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prefix Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

拒絕採樣微調

常見問題

What is Prefix Tuning?

前綴調整是一種參數有效的方法,透過訓練一小組連續向量來適應凍結的語言模型,這些連續向量會預先添加到每一層的輸入中。它允許您為新任務自訂巨型模型,同時更新不到 1% 的參數。

前綴調優實際上訓練什麼?

前綴調整凍結主幹網路並僅學習一小組連續前綴向量,從而保持參數高效。

前綴向量注入哪裡?

前綴調整在每個轉換器層的自註意力(而不僅僅是輸入)處預先考慮可訓練的鍵/值向量。

誰引入了前綴調整以及大約何時引入的?

前綴調整由史丹佛大學的Xiang Lisa Li和Percy Liang於2021年提出。

為什麼前綴調整對於服務許多任務很有吸引力?

由於只有小前綴是特定於任務的,因此您可以為每個任務儲存一個小文件,而不是複製整個模型。

經常使用什麼技巧來穩定前綴訓練?

為了穩定性,一個小的 MLP 在訓練期間產生前綴,然後被丟棄,只留下學習到的前綴矩陣。