基础知识指南

迁移学习

迁移学习重用已经在大型数据集上训练的模型,并将其适应新的相关任务。

阅读时间:2分钟最后更新

概述

Instead of starting from scratch, you stand on the shoulders of a model that already learned useful general features, saving enormous time, data, and compute.

深入探讨

从零开始训练强大的模型通常需要数百万个标记示例和强大的硬件。迁移学习回避了这一点。在大型数据集上进行预训练的模型,例如在 ImageNet 上训练的图像网络或在网络文本上训练的语言模型,已经学习了广泛有用的模式:视觉的边缘和形状、文本的语法和含义。您采用该预训练模型并使其知识适应您较小的具体问题。主要有两种风格。在特征提取中,您冻结大部分网络并仅在顶部训练一个新的输出层。在微调过程中,您还可以解冻一些更深的层,并继续以低学习率训练它们,以便模型轻轻地调整您的数据,而不会忘记它所知道的内容。

技术洞察

预训练的网络学习层次结构:早期层捕获通用特征(边缘、纹理、基本单词关系),而后面的层捕获特定于任务的概念。迁移学习利用了这一点。如果您的任务与原始任务类似,请将早期层冻结为固定特征提取器并仅重新训练头部。如果您的数据差异较大,请使用非常小的学习率微调更深的层,以便更新是温和的。最大的风险是领域转移:如果新数据看起来与预训练数据差异太大,那么借用的特征就不太适合。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

迁移学习的未来

迁移学习已成为构建人工智能的默认方式。如今,几乎没有人从头开始训练大型视觉或语言模型;团队改为采用预先训练的基础模型。最前沿的是 LoRA 和适配器等参数高效的方法,它们只需调整一小部分权重即可以低成本定制巨型模型。预计这种趋势将会加深:从大型模型中提取和微调的更小的、专业的模型,加上人们越来越关注在模型反复调整时减轻领域转移和避免“灾难性遗忘”。

现实世界的实施

微调 ImageNet 预训练网络,仅用几千张照片即可检测工厂生产线上的特定缺陷

通过对较小的专业语料库进行微调,采用大型预训练语言模型来起草法律或医学摘要

使用一般语音训练的模型作为起点来构建特定口音或方言的识别器

重新训练视觉模型的最后一层,以根据农业应用程序的叶子图像对植物病害进行分类

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录迁移学习在哪些方面有帮助以及哪些更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Transfer Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

半监督学习

常见问题

What is Transfer Learning?

迁移学习重用已经在大型数据集上训练的模型,并将其适应新的相关任务。您无需从头开始,而是站在已经学习了有用的一般特征的模型的肩膀上,从而节省大量时间、数据和计算。

迁移学习的核心思想是什么?

迁移学习采用已经学习了一般特征的模型并对其进行调整,从而节省数据、时间和计算。

为什么在微调更深层时使用非常低的学习率?

小数据集上的大更新可能会覆盖有价值的预训练特征并快速过度拟合,因此更新保持较小。

哪种情况最适合简单特征提取(冻结基础)?

当目标任务接近原始任务且数据有限时,冻结的特征已经相关,因此只需要一个新的头。

“领域转移”描述了迁移学习中的什么问题?

如果目标域看起来与模型预训练的域非常不同,则重用的特征可能无法很好地传输并且准确性会下降。

为什么预训练网络的早期层通常比后面的层更容易重用?

早期的层捕获广泛有用的低级模式,而后面的层则更专门用于原始任务。