彩票假说
彩票假说认为,在一个大型的、随机初始化的神经网络内部隐藏着一个小的子网络——一张“中奖彩票”——它通过相同的初始权重单独训练,可以匹配整个网络的准确性。
概述
It matters because it suggests we are training far more parameters than we actually need.
深入探讨
该假设由麻省理工学院的乔纳森·弗兰克尔和迈克尔·卡宾于 2018 年提出,源于修剪研究。通常,您可以将经过训练的网络修剪至其权重的 10-20%,而不会损失准确性,但从头开始训练该小型网络会失败。弗兰克尔和卡宾找到了窍门:保留幸存连接的原始初始权重。然后,稀疏的子网络(中奖彩票)会独立训练到完全准确,有时比密集的原始子网络更快。他们通过“迭代幅度修剪”来识别票证:训练,修剪最小幅度的权重,将其余权重回滚到初始值,然后重复。结果表明,密集的超参数化主要有助于优化找到良好的稀疏结构,而不是所有这些权重都是单独必要的。
技术洞察
核心过程是带有权重倒带的迭代幅度修剪:训练后,删除最低幅度的权重,将剩余的权重重置为其原始初始化(或早期训练检查点,称为“倒带”的细化),然后重新训练。特定的稀疏掩码及其匹配的初始化的组合使得票证“获胜”——随机重新初始化相同的掩码会破坏效果。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
彩票假说的未来
彩票推动了从一开始就训练稀疏网络以节省计算和能源的研究,以及彩票是否跨数据集和任务传输的研究。将迭代剪枝扩展到十亿个参数模型仍然很昂贵,因此我们继续致力于廉价地找到彩票或证明它们存在(“强”彩票假设认为彩票在初始化时就存在,根本不需要训练)。期待与高效的设备上模型和绿色人工智能的搭配。
现实世界的实施
将大型图像分类器压缩至其权重的 20% 以下,以便部署在手机上,同时保持准确性
通过仅识别和训练稀疏获胜子网络来加速训练
通过重复使用在一个数据集上找到的票证来快速启动相关数据集的训练来研究权重可转移性
通过运送修剪过的中奖彩票而不是密集模型来减少边缘设备中的推理能量和内存
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录彩票假设在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Lottery Ticket Hypothesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Lottery Ticket Hypothesis?
彩票假说认为,在一个大型的、随机初始化的神经网络内部隐藏着一个小的子网络——一张“中奖彩票”——它通过相同的初始权重单独训练,可以匹配整个网络的准确性。这很重要,因为它表明我们训练的参数远多于我们实际需要的参数。
这个假设中的“中奖彩票”是什么?
中奖彩票是一个小型子网络,当独立于相同的初始权重进行训练时,它可以达到与密集网络相当的准确性。
为什么训练修剪后的子网络通常会失败,除非你做了一些特殊的事情?
关键的见解是稀疏掩码仅在与匹配的原始初始化配对时才起作用;随机重新初始化会破坏它。
彩票假说是谁提出的?
乔纳森·弗兰克尔 (Jonathan Frankle) 和迈克尔·卡宾 (Michael Carbin) 在 2018 年麻省理工学院的论文中介绍了这一假设。
使用什么技术来找到中奖彩票?
迭代幅度剪枝反复训练,删除最小幅度的权重,并将其余权重恢复到初始值。
对于大型过度参数化网络,该假设有何启示?
这一发现意味着过度参数化有助于搜索可训练的稀疏子网络,而不是每个权重都是必需的。