顿悟现象

关注
义项:机器学习训练现象

顿悟现象是机器学习训练中出现的一种学习模式:模型先记住训练数据,训练准确率很快接近完美,但在测试数据上的表现长期停留在接近随机的水平,只有继续训练很久之后才会突然大幅提升。[1][2][3] 它也被称为延迟泛化,2022 年由 Power 等人在小型算法数据集上首次报道,因说明模型在严重过拟合之后仍可能学会任务规则而受到关注。[4][5][5]

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

顿悟现象指神经网络在训练过程中先记住训练数据、训练准确率很快接近完美,而验证或测试表现长期不佳,随后在训练继续进行很久之后突然大幅提升的学习模式。[1][6][2][3] 它属于延迟泛化,即泛化能力出现的时刻比训练损失降到接近零的时刻晚得多。[2][3]

与一般直觉相反,测试性能的跃升发生在模型已经严重过拟合之后,而不是更早。[5] 有研究把这种曲线整理成判别标准:训练集表现收敛之后,测试集表现才从低水平区间转移到高水平区间,并在其后一段时间内维持在这一水平。[7]

原理

常见的诱发条件包括训练数据稀疏、初始权重幅度较大以及正则化强度较高,不过后续研究认为这些因素能够诱发顿悟,却并不构成完整的解释。[8]

一种解释关注权重范数的大小。训练中的权重衰减会把参数范数缓慢压向一个合适的范围,只有进入这个范围,模型才会由记忆解切换到泛化解,因此该范围被称为“金发姑娘区”。[9][10] 也有工作把顿悟归因于网络从惰性训练转向特征学习:前期网络在初始特征构成的线性化模型内拟合训练集,后期才开始真正改变内部表示。[11][12]

从表示的角度看,模型最终会学到任务本身的结构。以模运算任务为例,完成泛化的模型内部表示呈现出明显的傅里叶变换频率特征,对应任务的循环结构。[9][13] 也有研究借用相变的语言,把记忆阶段描述为快速冷却后的非平衡状态,把泛化阶段描述为缓慢弛豫到更稳定的构型。[14] 另有工作把该过程分为 3 个阶段:先记忆数据,再获取任务的内在对称性,最后形成低维几何结构。[13]

发展历程

2022 年,Power 等人在小型算法数据集上首次使用 grokking 一词描述这一现象,报告模型能够从接近随机的水平提升到完全泛化,并且这种提升可以发生在过拟合很久之后;他们还发现数据集越小,实现泛化所需的优化步数越多。[4][5][15]

同年,Liu 等人提出一种有效理论,在超参数平面上观察到理解、顿悟、记忆、困惑 4 种学习阶段,认为表示学习只发生在记忆与困惑之间的“金发姑娘区”,并指出Transformer模型上的顿悟阶段更靠近记忆阶段,因而表现为延迟泛化。[9]

2023 年,Nanda 等人对训练模运算任务的单层 Transformer 做了机械可解释性分析,发现网络借助离散傅里叶变换与三角恒等式完成计算。[7] 此后研究把顿悟扩展到模运算之外,包括线性回归、高斯过程回归和图像分类等场景,并有工作表明该现象并不限于神经网络。[10] 后来 ACM Computing Surveys 刊出了名为《A Survey on Grokking》的综述,对该方向的研究进行整理。[16]

应用

顿悟现象对训练流程有直接影响:它说明模型在过拟合之后仍可能继续改善,因此仅依据验证集表现中止训练的做法,可能过早结束仍有泛化潜力的训练过程。[7][11] 有研究据此建议重新考虑早停法等停止准则,把后期泛化出现的可能性纳入判断依据。[7]

研究也尝试缩短或消除从记忆到泛化的等待期。把训练中的权重范数限制在半径合适的球面上、在训练中施加稀疏掩码、把已泛化模型的嵌入迁移到目标模型、放大梯度中的特定成分等方法,都被报告可以加速顿悟。[10]

由于顿悟呈现了从记忆转向理解的完整过程,它被用作观察神经网络内部表示重组的实验窗口,相关分析把顿悟与注意力能否路由到关键信息、参数范数以及结构对齐程度联系起来。[17] 模运算等算法数据集是这类研究常用的测试平台。[13]

局限

直到近年,文献中仍只有对该现象的描述和例子,没有形成公认定义,这给不同研究之间的比较带来困难;顿悟出现的时刻也难以事先预测。[7] 该现象还只在特定的数据规模区间内出现,数据量足够大时训练与验证损失会同步变化,顿悟随之消失。[11]

解释层面存在分歧。把顿悟主要归因于权重范数下降或权重衰减的观点有反例:在模运算与多项式回归任务中,最终泛化解的参数范数反而大于初始记忆解,且不需要权重衰减也能观察到顿悟;关于记忆电路与泛化电路何者更“高效”,不同理论给出的判断也不一致。[11]

现有加速手段多附带代价:直接限制权重范数会带来训练不稳定,由彩票假设得到的稀疏掩码需要先训练同一模型直到其完成泛化,迁移嵌入的方法则需要额外数据或预训练。[10]

即便完成顿悟,模型对新知识的整合能力仍然有限,有研究发现成熟电路在整合新知识时可迁移性不足,说明已经顿悟的 Transformer 并未达到对组合逻辑的完全掌握。[18]

参见

  • 过拟合 —— 顿悟现象出现在模型严重过拟合训练数据之后。

  • 延迟泛化 —— 顿悟现象在文献中的另一个常用名称。

  • 权重衰减 —— 常被讨论的诱发或加速顿悟的超参数。

  • 相变 —— 部分研究用来描述记忆到泛化突变的物理类比。

  • 机械可解释性 —— 用于分析顿悟过程中网络内部电路与表示的方法。

  • 早停法 —— 依据验证性能提前结束训练的做法,顿悟现象对其构成挑战。

参考资料

  1. 【期刊论文】 Grokking in Neural Networks: A Review NSTL 国家科技图书文献中心 . 国家科技图书文献中心 [引用日期2026-09-29]
  2. Inducing Grokking with Distribution Shifts . IEEE Xplore [引用日期2026-09-29]
  3. S0950705126003692 . ScienceDirect.com [引用日期2026-09-29]
  4. S0925231225010197 . ScienceDirect.com [引用日期2026-09-29]
  5. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  6. paper_detail . 国家科技图书文献中心 [引用日期2026-09-29]
  7. Grokking Explained: A Statistical Phenomenon . arxiv.org [引用日期2026-09-29]
  8. Inducing Grokking with Distribution Shifts . ieee.org [引用日期2026-09-29]
  9. acm.org 上的网页 . acm.org [引用日期2026-09-29]
  10. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  11. harvard.edu 上的文件 . harvard.edu [引用日期2026-09-29]
  12. acm.org 上的网页 . acm.org [引用日期2026-09-29]
  13. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  14. Is Grokking a Computational Glass Relaxation? . NIPS Paper [引用日期2026-09-29]
  15. edsarx,edsarx.2201 . cas.cz [引用日期2026-09-29]
  16. A Survey on Grokking | ACM Computing Surveys . acm.org [引用日期2026-09-29]
  17. arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
  18. aclanthology.org 上的网页 . ACL Anthology [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:45:30Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
神经网络 过拟合 权重衰减 傅里叶变换 相变 Transformer 机械可解释性 模运算 早停法 彩票假设 过拟合 延迟泛化 权重衰减 相变 机械可解释性 早停法
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。