早于LeCun相似研究一年!千诀科技联合清华团队让神经网络「简单性」可测可优化

栏目:互联网 | 来源:机器之心Pro | 2026-08-06 17:52

千诀科技联合清华大学团队,为神经网络提出了一把新的 “复杂度标尺”。
随着模型训练数据量的增大,我们有越来越多的 benchmark 可以用于评价一个模型答得准不准,却很难判断它究竟学到了可迁移的规律,还是用复杂方式 “记住” 了训练数据。团队提出的 “有效阶”(Effective Degree,ED),首次将这项研究路线中抽象的 “简单性偏置”,转化为一个能在真实规模模型上计算、比较并直接参与训练的指标。
这项研究不仅为理解神经网络为什么能够泛化提供了新工具,未来还有望用于筛选预训练模型、诊断微调过拟合,并改善视觉、语言、强化学习及世界模型面对新数据和新环境时的表现。
值得关注的是,这条研究路线与图灵奖得主 Yann LeCun 团队近期受到关注的世界模型理论形成了呼应,而千诀科技与清华团队对相似方法论视角的公开研究,比 LeCun 团队早约一年。

今年 5 月, Yann LeCun 与 David Klindt、Randall Balestriero 的论文《When Does LeJEPA Learn a World Model?》一经发布便获得广泛关注。论文从隐变量可辨识性的角度研究 LeJEPA 驱动的世界模型,并用 Hermite 多项式将高斯世界中的函数按非线性次数分解:非线性阶数越高,在 LeJEPA 的 alignment 目标下受到的惩罚越强,因此线性恢复真实隐变量成为最优解。

值得注意的是,早在一年前,清华大学自动化系陈峰教授和千诀科技的联合团队(第一作者章天任)就在 ICML 2025 论文《When Do Neural Networks Learn World Models?》中采用了相近的方法论视角:将 “学习世界模型” 形式化为对数据生成隐变量的恢复(辨识)问题,并通过正交函数基将复杂函数分解为不同阶次,研究神经网络在解空间的低阶偏置如何促使真实隐变量变得可辨识。

两项研究使用的数学工具并不完全相同:千诀 - 清华团队研究多任务学习设定下具有低阶偏好的神经网络模型,使用 Fourier-Walsh 变换分析离散布尔世界;LeCun 等人研究 LeJEPA 及带平稳动力学的高斯世界,使用 Hermite 多项式进行谱分解。但二者尝试回答的关键问题和技术路径又是相似的:从隐变量可辨识性出发,用函数的阶次刻画 “简单性”,再借助训练目标对低阶解的偏好,解释模型何时能够恢复世界的真实结构。

如今,千诀 - 清华团队又把这条理论线索向现实模型推进了一步。

在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,研究团队不再只问 “低阶偏好为何能帮助模型学到世界结构”,而是进一步追问:这种偏好能不能在真实的 ResNet、ViT、语言模型和强化学习策略网络上被直接测量,甚至被主动优化?

他们给出的答案是 “有效阶”(Effective Degree,ED):沿真实数据点之间的插值路径观察高维神经网络,用正交多项式拟合模型输出,再根据不同阶次成分的权重计算函数复杂度。由此,“简单性偏置” 从团队上一项工作中的理论假设,变成了一个兼具通用性、可计算性和可微性的实用工具。

要理解 ED 解决了什么问题,还要回到深度学习中的一个经典谜题:为什么参数量远多于训练样本的神经网络,依然能在未见数据上表现良好?

一个广为接受的解释是 “简单性偏置”(simplicity bias):面对许多都能拟合训练数据的函数,神经网络及其训练过程并非随机选择,而是更倾向于学到相对简单的那个。类似奥卡姆剃刀,越简单的规律,往往越有可能超越有限样本,迁移到新的数据分布。

但一个基础问题始终没有令人满意的答案:对于现代深度神经网络,我们究竟该如何定义并测量 “简单”?

参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩长度…… 已有研究提出了不少候选指标,但往往难以同时做到三点:

  1. 通用性(generality):不依赖某一种特定网络架构或任务;
  2. 可量化(quantifiable):能在真实规模的已训练模型上稳定计算;
  3. 可优化(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。

千诀 - 清华团队尝试给出一个同时满足上述要求的答案。

他们提出了一种多项式表征(polynomial representations)方法:

  • 用数据点之间的插值路径 “切开” 高维神经网络,并以正交多项式近似网络沿路径的行为;
  • 用多项式表征的有效阶(effective degree,ED)衡量神经函数的简单性;
  • 将 ED 进一步变成可微的正则项,实现对神经函数复杂度的在线优化。

实验中,ED 不只是一个事后分析指标:在多个 benchmark 上,ED 都可以相当精确地预测出模型的实际 generalization gap;在对神经网络 grokking 现象的分析中,ED 也呈现出比参数范数、sharpness 等指标更稳定的信号。更进一步,由于整个度量过程可微,研究团队还将 ED 写入训练目标,在图像、文本、视觉 - 语言模型和强化学习任务中直接优化模型的函数复杂度,并由此带来泛化性能的提升。

  • 论文标题:Quantifying and Optimizing Simplicity via Polynomial Representations
  • 论文作者:章天任、李向欣、肖明昊、陈冠宇、陈峰
  • 论文地址:https://arxiv.org/abs/2605.29823
  • 代码地址:https://github.com/xinzaixinzai/Effective-Degree

“简单” 为什么难以测量?

衡量神经网络复杂度的一种常见思路是观察参数空间。例如,参数范数越小,或者局部损失面越平坦(也即 sharpness 越小),模型也许就越简单。

但参数并不等于函数。同一个函数可以由尺度和参数化方式截然不同的权重实现;即便网络输出完全不变,一次重参数化也可能显著改变参数范数或 sharpness。换言之,这些指标有时反映的是模型 “如何被写出来”,而不一定是模型实现的函数本身有多复杂。

另一种更直接的思路,是在函数空间里定义复杂度。线性函数通常比二次函数简单,二次函数又比高阶振荡函数简单,因此按多项式次数衡量非线性程度十分自然。

然而,现代神经网络往往是从高维输入到高维输出的黑盒函数。如果直接在原始空间拟合多元多项式,基函数数量会随维度和阶数发生组合爆炸,在真实模型上几乎不可计算。

研究团队由此采用了一个降维视角:不试图一次看清整个高维函数,而是沿数据分布附近的许多一维路径观察它。

沿数据路径,给高维神经网络做 “函数切片”

给定从数据分布中采样的两个样本 x₁、x₂,团队在二者之间构造插值路径:x (α) = αx₁ + (1-α) x₂,α ∈ [0,1]

对于神经网络 f,模型沿这条路径的输出就变成了一个关于单变量 α 的函数。一个原本高维且复杂的神经函数,由此转化为许多条一维的 “函数切片”。

接下来,团队使用 Chebyshev 正交多项式近似每条路径上的模型行为。如果模型输出沿路径接近线性变化,能量会集中在低阶系数上;如果输出频繁振荡,就需要更多高阶项才能描述。

一个自然的问题是:把高维函数限制到一维路径,会不会破坏原有的复杂度排序?论文给出的理论结果显示:对于多元多项式,只要插值方向来自具有密度的数据分布,随机路径几乎必然保留其代数阶;也即,对多条路径取平均后,不同阶多项式的复杂度顺序仍能被正确区分。

在实际计算中,研究团队还加入了三项设计:使用数据相关路径,将测量集中在真实数据分布附近;使用 Chebyshev 正交多项式基和余弦采样,缓解高阶拟合的数值不稳定;对于高维输出,可沿每条路径使用 PCA,只保留主要变化方向再进行拟合。

有效阶:不只看 “最高几阶”,还看每一阶有多重要

严格的代数阶只取决于最高阶非零系数。即使某个高阶项系数小到几乎可以忽略,函数仍会被判定为 “高阶”,这使它对数值噪声和真实神经网络中的微小扰动非常敏感。

为此,论文定义了多项式表征的有效阶 ED:它可以被理解为 “各阶成分按系数幅度加权后的平均复杂度”。低阶成分占主导时,ED 较小;高阶成分越多、幅度越大,ED 就越高。与只看最高非零阶不同,ED 关于拟合系数是连续且稳定的。最后,对从数据分布中采样的多条路径取平均,即可得到整个神经网络的复杂度估计。

图 1:多项式表征方法总览。沿真实数据点之间的插值路径观察神经函数,以正交多项式拟合每条路径上的输出,并根据不同阶次的系数计算函数复杂度 ED。

ED 的定义有两个关键特征。第一,它位于函数空间,不直接依赖模型如何参数化;第二,它与数据分布相关,因此衡量的实际上是模型在真实数据附近表现出的复杂度,这也符合模型实际使用场景的需要。

ED 能预测泛化吗?

团队首先把 ED 作为训练后的评价指标,与参数范数、sharpness 和 adaptive sharpness 等现有的常用 generalization proxy 进行比较。

在 CIFAR-10 上,他们使用 27 组不同超参数分别训练 ResNet18 和 ViT-Tiny。对于 ResNet18,ED 与 generalization gap 的 Pearson 相关系数达到0.99,线性拟合 R² 达到0.98。相比之下,表现最好的 sharpness 指标相关系数为 0.94,R² 为 0.88。也就是说,模型在数据路径上的高阶成分越多,训练集与测试集之间的差距往往也越大。

图 2:ResNet18 在 CIFAR-10 上的结果。相比 sharpness、adaptive sharpness 与参数 L2 范数,ED 与 generalization gap 呈现出最强的线性相关性。

在 CLIP ViT 的 ImageNet 微调实验中,ED 同样与泛化间隙保持稳定正相关;sharpness、adaptive sharpness 和参数范数在这一设置下则表现出较弱、甚至方向相反的相关性。这也侧面印证了基于参数空间而非函数空间的泛化界度量的不鲁棒性。

图 3:CLIP ViT 在 ImageNet 上的结果。ED 与 generalization gap 保持正相关,而其他指标在这一设置下呈负相关。

ED 还能揭示同一个模型在训练过程中的复杂度变化。在经典的神经网络 grokking 现象中,模型通常先记住训练集,经过很长时间后才突然获得泛化能力。实验显示,ED 在记忆阶段逐渐升高,在验证损失开始骤降的转折点附近达到峰值,随后随着泛化形成而下降。参数范数在整个过程中单调增大,sharpness 也没有清晰地标出这一相变。

图 4:Grokking 实验结果。只有 ED 可以捕捉到模型在训练过程中从记忆到泛化的相变。

这意味着,ED 不仅可以比较不同模型在训练完成后的复杂度和泛化界,还可能追踪一个模型在训练过程中如何从 “记忆样本” 转向 “归纳规律”。

从测量简单性到优化简单性

如果 ED 只能作为一个模型复杂度评估指标,它仍然只是一个分析工具。论文更进一步指出,由于多项式拟合本质上是一个最小二乘问题,拟合系数对网络输出具有解析梯度,因此 ED 可以自然地穿过拟合过程,反向传播到模型参数。

研究团队由此将 ED 作为显式正则项加入原任务目标。它并不强迫模型沿插值路径严格线性,也不要求人为给插值样本指定 “正确标签”;它只是惩罚不必要的高阶变化,让模型在完成原任务的同时,优先选择相对简单的函数。

实验覆盖了图像与文本监督分类、视觉 - 语言模型微调和强化学习等场景。在 CLIP 微调中,加入 ED 正则的模型在分布内准确率与平均分布外准确率的权衡上整体优于标准微调;在多个强化学习环境中,ED 正则也带来了更好的训练表现。

图 5:ED 正则化在强化学习任务上的表现。

“简单” 未必等于 “正确”

论文也明确讨论了方法的边界:“越简单越好” 并非无条件成立。

如果数据中最简单的特征恰好是一个不稳健的 shortcut,ED 可能与普通模型一样优先利用它。ED 描述的是函数复杂度,并不等同于正确性、语义合理性或公平性。如何让 “简单” 与正确的归纳偏置对齐,仍需要数据、任务目标和模型架构共同参与。

此外,路径多项式只是高维函数的一种分布相关代理;训练时采样额外插值点,也会带来一定计算开销。

总结

千诀 - 清华团队的研究工作给出了一个从函数空间理解神经网络的新工具:在表征层面,用数据相关路径上的正交多项式紧凑描述高维神经函数;在度量层面,用有效阶稳定量化高阶成分,并预测模型的泛化行为;在优化层面,通过可微的多项式拟合,使得模型的复杂度或简单性可以被在线优化。

从更广泛的视角看,多项式表征在理论与实践之间搭起了一座桥:理论上,模型的低阶偏置可以帮助研究者分析神经网络为何可能学到世界模型;实践中,“有效阶” 让这种偏好也可以被测量和干预。

由此也产生了一系列值得继续追问的问题:不同架构和优化器会形成怎样的 ED 动态?ED 能否用于选择预训练 checkpoint、诊断微调过拟合,或设计更适合世界模型的自监督任务?除了多项式次数,是否还存在其他同时具备通用性、可计算性与可微性的函数空间表征?

参考文献

[1] Zhang, T., Li, X., Xiao, M., Chen, G., & Chen, F. Quantifying and Optimizing Simplicity via Polynomial Representations. ICML, 2026. https://arxiv.org/abs/2605.29823

[2] Zhang, T., Chen, G., & Chen, F. When Do Neural Networks Learn World Models? ICML, 2025. https://arxiv.org/abs/2502.09297

[3] Klindt, D., LeCun, Y., & Balestriero, R. When Does LeJEPA Learn a World Model? arXiv preprint, 2026. https://arxiv.org/abs/2605.26379

了解更多

猜你想看

← 返回首页