摸索和延迟泛化
Grokking 是一种令人吃惊的现象,神经网络首先记住其训练数据,长时间保持接近于零的验证精度,然后在训练精度达到 100% 后很长一段时间内突然泛化。
概述
It overturns the intuition that learning and generalization happen together.
深入探讨
grokking 由 OpenAI 研究人员于 2021 年在模块化算术等小型算法任务中发现,它显示出尖锐的两相曲线。早期,该模型完美地拟合了训练集,而验证性能仍然不稳定,看起来无可救药地过度拟合。然后,在数千甚至数百万的额外步骤没有明显进展之后,验证准确性突然跃升至近乎完美。主要的解释是,权重衰减(正则化)慢慢地迫使网络放弃脆弱的记忆解决方案,并发现一种紧凑的、结构化的解决方案,该解决方案实际上捕获了基本规则,例如将模加法表示为圆上的旋转。 Grokking 在小型合成数据集上最为明显,但理解它可以揭示泛化何时以及为何出现的更深层机制。
技术洞察
Mechanistic 研究了逆向工程 grokked 网络,发现它们实现了干净的算法,例如使用类似傅立叶的圆形嵌入通过三角恒等式执行模块化算术。这种转变与正则化下网络权重变得更稀疏和更低范数相关:记忆需要大的、不规则的权重,而泛化电路更简单。因此,Grokking 说明了快速找到的记忆解决方案与形成较慢、更有效的泛化解决方案之间的竞争。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
Grokking 的未来和延迟泛化
Grokking 是通向泛化科学的一扇窗口,研究人员希望扩大这一范围。悬而未决的问题包括延迟泛化是否在大型模型中悄然发生,如何检测或加速转变,以及了解模型何时真正学习了概念与记忆的示例意味着什么。洞察力可以为更好的正则化、训练计划和可解释性工具提供信息,并可以帮助预测大型语言模型中的新兴功能。
现实世界的实施
研究模块化算术任务以对网络学习的精确电路进行逆向工程
展示权重衰减如何推动从记忆到真正泛化的转变
通过提供清晰、完全理解的模型行为进行分析,为可解释性研究提供信息
警告从业者,早期验证停滞并不总是意味着模型无法学习
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录 Grokking 和延迟泛化在哪些方面有帮助,以及哪些更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grokking and Delayed Generalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Grokking and Delayed Generalization?
Grokking 是一种令人吃惊的现象,神经网络首先记住其训练数据,长时间保持接近于零的验证精度,然后在训练精度达到 100% 后很长一段时间内突然泛化。它颠覆了学习和泛化同时发生的直觉。
神经网络训练中的 grokking 的定义是什么?
Grokking 是指在训练准确率已经达到 100% 之后,突然跃升到良好的验证性能。
grokking 首先在哪些类型的任务上被显着观察到?
OpenAI 研究人员在 2021 年报告了对模加法等小型合成算法问题的探索。
哪个因素最常被认为推动了摸索向泛化的转变?
权重衰减逐渐将网络从脆弱的记忆解决方案推向紧凑的泛化电路。
当研究人员对模运算的 grokked 网络进行逆向工程时,他们发现了什么?
机械可解释性揭示了网络学习了三角、圆形表示来计算模算术。
为什么 grokking 被描述为两种解决方案之间的竞争?
网络很快找到一个记忆解决方案,但在正则化下,最终收敛到一个更简单的泛化电路。