语言人工智能指南

用于传输的适配器层

适配器层是插入冻结的预训练模型中的微小可训练模块,让您只需更新百分之几的参数即可使其适应新任务。

阅读时间:2分钟最后更新

概述

They make fine-tuning cheap, modular, and easy to swap.

深入探讨

适配器,由 Houlsby 等人推广。 (2019)对于 NLP 中的迁移学习,解决了一个代价高昂的问题:完全微调更新大型模型中的每个权重,并为每个任务生成一个全新的副本。相反,适配器将小型瓶颈网络插入到每个变压器块中,通常是低维下投影、非线性和上投影返回,包裹在剩余连接中。在训练期间,原始预训练权重保持冻结状态;仅学习适配器(通常低于总参数的 5%)。这可以在 GLUE 等基准测试上产生近乎完全微调的质量,同时训练的参数要少得多。因为每个任务都有自己的小型适配器,所以您可以存储一个基本模型和许多轻量级任务模块,并交换甚至堆叠它们。适配器与 LoRA 和前缀调整一样,是参数高效微调 (PEFT) 系列的基本成员。

技术洞察

经典的瓶颈适配器将 d 维隐藏状态投影到更小的维度 m,应用非线性,然后使用跳跃连​​接投影回 d,以便它开始接近恒等。由于 m 远小于 d,因此添加的参数很小。由于基本模型被冻结,梯度仅流经适配器权重,从而大幅削减优化器内存。主要的运行时成本是每层的少量额外延迟,LoRA 等方法通过将学习到的权重合并回基础矩阵来减少延迟。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

传输适配器层的未来

适配器和更广泛的 PEFT 工具包现已成为经济实惠地定制大型模型的标准配置,尤其是在模型尺寸不断增大的情况下。预计适配器组合(以模块化方式组合任务或语言适配器,如 AdapterHub 中的适配器)、推理时许多适配器之间的路由以及设备上个性化(其中小型适配器为每个用户定制共享基础模型)的增长。 LoRA 变体因纯粹的效率而日益占据主导地位,但冻结巨型模型并训练小型插件的基本思想现在是该领域如何扩展定制的核心。

现实世界的实施

添加特定于语言的适配器,以便可以专门用于斯瓦希里语等多语言模型,而无需重新训练整个网络。

在 SaaS 产品中维护一个基本模型以及数十个小型每客户适配器,并根据请求交换正确的适配器。

通过仅训练百分之几的适配器来微调情感分类模型,然后为其他任务保留共享的基础。

将任务适配器堆叠在域适配器之上(例如,合法文本适配器加摘要适配器)以进行模块化重用。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adapter Layers for Transfer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

T5 和文本到文本传输

常见问题

What is Adapter Layers for Transfer?

适配器层是插入冻结的预训练模型中的微小可训练模块,让您只需更新百分之几的参数即可使其适应新任务。它们使微调变得便宜、模块化并且易于更换。

使用适配器进行训练时,原始预训练权重会发生什么变化?

适配器调整使基本模型保持冻结并仅学习小的插入模块。

瓶颈适配器的典型内部结构是什么?

经典适配器将隐藏状态压缩到低维度,应用非线性,投影备份,并添加跳跃连接。

适配器通常训练的参数比例大约是多少?

适配器通常仅添加和训练模型总参数的百分之几,远少于完全微调。

为什么适配器可以方便地执行许多任务?

由于每个任务只需要一个小型适配器,因此一个共享基础模型可以通过交换轻量级模块来服务于许多任务。

适配器属于哪一个技术系列?

适配器是一种核心 PEFT 方法,还有 LoRA 和前缀调整等方法。