主动学习
主动学习是一种训练策略,模型本身会选择人类接下来应该标记哪些未标记的示例。
概述
It matters because labeling data is expensive, and smart selection can reach high accuracy with a fraction of the annotations.
深入探讨
大多数监督学习假设您已经拥有大量标记数据。主动学习翻转了这一点:你从一个小的标记集和大量未标记的示例开始,然后反复要求人类(“预言家”)仅标记信息最丰富的示例。该模型经过训练,用于对未标记的池进行评分,并且发送最高值的示例进行标记 - 然后重复循环。常见的选择策略包括不确定性抽样(选择模型最不自信的示例)、委员会查询(选择整体不同意的地方)和多样性抽样(覆盖数据的不同区域)。如果做得好,主动学习可以使用更少的标签来匹配完整数据集的准确性,这就是它在医学成像、自然语言处理以及专家注释缓慢或昂贵的任何领域流行的原因。
技术洞察
核心思想是在付费标记每个未标记点之前估计其“价值”。不确定性采样使用模型自身的概率 - 例如,选择顶级类概率最接近机会的点,或者选择前两类之间具有最高熵或最小间隔的点。委员会询问训练多个模型并选择他们最不同意的点。一个关键的风险是抽样偏差:贪婪地追逐不确定性可能会忽略整个区域,因此通常会结合多样性或批量感知方法。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
主动学习的未来
主动学习越来越多地与大型预训练和基础模型相结合,其目标从标记所有内容转变为对一些高价值示例进行廉价的微调。预计与弱监督、自监督预训练和人机循环工具的更紧密集成,为审阅者提供标签以供确认而不是创建。由于标签成本在许多实际部署中占主导地位,因此自动选择加上高效的注释接口仍将是在医学和法律等数据稀缺的专业领域构建模型的核心。
现实世界的实施
放射学团队通过让模型标记最模糊的扫描供放射专家进行标记来训练肿瘤检测器,从而大大减少注释时间。
垃圾邮件或内容审核系统会显示人类审阅者最不确定的边界消息,在硬边界情况下改进得最快。
语音识别公司选择其模型最不确定的音频剪辑(口音、噪音)来发送转录,而不是标记随机剪辑。
电子商务目录使用委员会查询来挑选多个分类器不同意的产品图像,并优先考虑它们以进行手动类别标记。
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录主动学习在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Active Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Active Learning?
主动学习是一种训练策略,模型本身会选择人类接下来应该标记哪些未标记的示例。这很重要,因为标记数据非常昂贵,而智能选择可以通过一小部分注释达到高精度。
主动学习的主要目标是什么?
主动学习的目的是通过选择信息最丰富的点供人类注释,从而最大限度地提高每个标记示例的模型性能。
在主动学习中,什么是“神谕”?
预言机是标签源(通常是人类专家),模型在选定的示例上查询真实标签。
哪种策略选择模型最不自信的示例?
不确定性采样选择模型的预测概率最接近猜测的点,例如高熵或顶级类别之间的小差距。
委员会询问如何决定标记哪些示例?
委员会询问会训练一个整体,并优先考虑成员不同意的点,因为分歧标志着信息丰富的区域。
仅依赖不确定性抽样的主要风险是什么?
贪婪地追逐不确定点可能会过度关注一个区域而错过其他区域,因此通常会添加多样性或批量感知方法。