语言人工智能指南

LoRA 和参数高效调整

LoRA 允许您通过仅训练一小部分新权重(而不是全部数十亿)来定制巨大的预训练模型。

阅读时间:2分钟最后更新

概述

It is the trick that makes fine-tuning affordable on a single GPU and lets one base model serve dozens of specialized tasks.

深入探讨

完全微调会更新模型中的每个权重,对于数十亿参数的网络来说,每个新任务都需要巨大的内存和存储空间。 LoRA(低阶适应)采用了更智能的路线:它完全冻结原始权重,并在其旁边插入小型、可训练的“适配器”矩阵。关键的赌注是,专门化模型所需的改变是低秩的——它可以通过两个瘦矩阵来捕获,其乘积与大权重矩阵的形状相同,但需要学习的数字要少得多。通常您训练的参数低于 1%。结果是一个很小的适配器文件(有时只有几兆字节),您可以换入和换出。 QLoRA 更进一步,将冻结的基数量化为 4 位,让人们可以在消费硬件上微调大型模型。

技术洞察

对于权重矩阵 W,LoRA 将其更新表示为两个低秩矩阵 B 乘以 A 的乘积,其中 A 和 B 具有较小的内部维度 r(秩,通常为 8 或 16)。训练期间只学习 A 和 B; W 保持冻结状态。在推理时,适配器输出被添加到原始层的输出中,并且缩放因子(alpha)控制其影响。由于 B 乘 A 可以在训练后合并回 W,因此 LoRA 一旦融合到部署的模型中,就会增加零额外延迟。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

LoRA 和参数高效调整的未来

参数高效调整已成为组织适应开放模型的默认方式,并且这种方式将会深化。预计适配器生态系统将有数百个 LoRA 进行热插拔,甚至在一个共享基础之上组成,以及根据请求选择正确适配器的路由系统。 QLoRA 风格的量化调整不断扩大爱好者可以在家定制的模型的尺寸。研究仍在继续,包括更好的初始化、动态排名选择以及同时有效地服务多个适配器——使一个前沿基础模型成为无数廉价、专业变体的基础。

现实世界的实施

使用单个 GPU 而不是完整集群,根据医院的临床记录对 Llama 等开放模型进行微调

交付 10 MB LoRA 适配器,将普通聊天机器人转变为法律文档助手,而无需重新分发整个模型

使用 QLoRA 通过将冻结的基本权重量化为 4 位来微调消费类显卡上的大型模型

为每个客户托管一个基本模型并热插拔不同的 LoRA 适配器,以低廉的成本为许多专业助理提供服务

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LoRA and Parameter-Efficient Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is LoRA and Parameter-Efficient Tuning?

LoRA 允许您通过仅训练一小部分新权重(而不是全部数十亿)来定制巨大的预训练模型。这一技巧使得在单个 GPU 上进行微调变得经济实惠,并让一个基本模型可以服务于数十个专门任务。

LoRA微调背后的核心思想是什么?

LoRA 保持预训练权重冻结,并学习与其一起添加的小型低秩矩阵,仅训练一小部分参数。

为什么 LoRA 能够大幅降低微调成本?

由于只有小型适配器矩阵是可训练的,因此与更新所有数十亿个权重相比,内存和存储需求急剧下降。

LoRA 适配器中的“r”等级控制什么?

秩 r 是矩阵 A 和 B 共享的小内部维度; r 越高,适配器的容量越大,但需要训练的参数也越多。

QLoRA 如何扩展基本 LoRA 方法?

QLoRA 以 4 位精度存储冻结的基本权重,大大减少了内存,因此可以在单个消费级 GPU 上对非常大的模型进行微调。

为什么合并的 LoRA 适配器不会增加额外的推理延迟?

适配器更新 B 乘以 A 的形状与原始权重相同,因此可以直接折叠为 W,使部署的模型具有相同的尺寸和速度。