語言人工智慧指南

用於傳輸的適配器層

適配器層是插入凍結的預訓練模型中的微小可訓練模組,讓您只需更新百分之幾的參數即可使其適應新任務。

閱讀時間約2分鐘最後更新

概述

They make fine-tuning cheap, modular, and easy to swap.

深入探討

適配器,由 Houlsby 等人推廣。 (2019)對於 NLP 中的遷移學習,解決了一個代價高昂的問題:完全微調更新大型模型中的每個權重,並為每個任務產生一個全新的副本。相反,適配器將小型瓶頸網路插入到每個變壓器區塊中,通常是低維下投影、非線性和上投影返回,包裹在剩餘連接中。在訓練期間,原始預訓練權重保持凍結狀態;僅學習適配器(通常低於總參數的 5%)。這可以在 GLUE 等基準測試上產生近乎完全微調的質量,同時訓練的參數要少得多。因為每個任務都有自己的小型適配器,所以您可以儲存一個基本模型和許多輕量級任務模組,並交換甚至堆疊它們。適配器與 LoRA 和前綴調整一樣,是參數高效微調 (PEFT) 系列的基本成員。

技術洞察

經典的瓶頸適配器將 d 維隱藏狀態投影到更小的維度 m,應用非線性,然後使用跳躍連接投影回 d,以便它開始接近恆等。由於 m 遠小於 d,因此新增的參數很小。由於基本模型被凍結,梯度僅流經適配器權重,從而大幅削減優化器記憶體。主要的運行時成本是每層的少量額外延遲,LoRA 等方法透過將學習到的權重合併回基礎矩陣來減少延遲。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

傳輸適配器層的未來

適配器和更廣泛的 PEFT 工具包現已成為經濟實惠地定制大型模型的標準配置,尤其是在模型尺寸不斷增大的情況下。預計適配器組合(以模組化方式組合任務或語言適配器,如 AdapterHub 中的適配器)、推理時許多適配器之間的路由以及設備上個性化(其中小型適配器為每個用戶定制共享基礎模型)的增長。 LoRA 變體因純粹的效率而日益佔據主導地位,但凍結巨型模型並訓練小型插件的基本思想現在是該領域如何擴展定制的核心。

現實世界的實施

添加特定於語言的適配器,以便可以專門用於斯瓦希里語等多語言模型,而無需重新訓練整個網路。

在 SaaS 產品中維護一個基本模型以及數十個小型每客戶適配器,並根據請求交換正確的適配器。

透過僅訓練百分之幾的適配器來微調情緒分類模型,然後為其他任務保留共享的基礎。

將任務適配器堆疊在網域適配器之上(例如,合法文字適配器加摘要適配器)以進行模組化重複使用。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adapter Layers for Transfer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

T5 和文字到文字傳輸

常見問題

What is Adapter Layers for Transfer?

適配器層是插入凍結的預訓練模型中的微小可訓練模組,讓您只需更新百分之幾的參數即可使其適應新任務。它們使微調變得便宜、模組化並且易於更換。

使用適配器進行訓練時,原始預訓練權重會發生什麼變化?

適配器調整使基本模型保持凍結並僅學習小的插入模組。

瓶頸適配器的典型內部結構是什麼?

經典適配器將隱藏狀態壓縮到低維度,應用非線性,投影備份,並添加跳躍連接。

適配器通常訓練的參數比例大約是多少?

適配器通常只添加和訓練模型總參數的百分之幾,遠少於完全微調。

為什麼適配器可以方便地執行許多任務?

由於每個任務只需要一個小型適配器,因此一個共享基礎模型可以透過交換輕量級模組來服務許多任務。

適配器屬於哪一個技術系列?

適配器是一種核心 PEFT 方法,還有 LoRA 和前綴調整等方法。