返回信息流
新闻事件
A重点83
机器之心
1 个来源

千诀科技联合清华团队提出“有效阶”指标,让神经网络简单性可测可优化

千诀科技与清华大学团队合作,提出了一种名为“有效阶”的新指标,用于量化神经网络的简单性偏置。该指标可在真实规模模型上计算,并可直接参与训练优化,为理解神经网络泛化提供了新工具。研究团队称,其方法论视角比Yann LeCun团队的相关研究早约一年,未来有望用于筛选预训练模型和诊断过拟合。

SynthePulse Insight · AI 深度解读

有效阶:让神经网络的“简单性”可测可优化

版本 1 · 1 个来源

千诀科技与清华团队提出“有效阶”(ED)指标,将神经网络的简单性偏置转化为可计算、可优化的工具,并声称比LeCun团队类似研究早约一年。

  • 千诀科技与清华团队提出“有效阶”(ED),沿数据插值路径用正交多项式拟合神经网络,量化函数复杂度。
  • ED在CIFAR-10上预测泛化差距的相关系数达0.99,优于sharpness等指标。
  • ED可微,能作为正则项直接优化,在图像、文本、视觉-语言模型和强化学习任务中提升泛化。
  • 团队称其方法论视角比LeCun团队类似研究早约一年,但数学工具不同。
  • ED并非无条件“越简单越好”,可能利用不稳健的shortcut,且计算有额外开销。
展开章节目录背景:简单性偏置与测量难题

背景:简单性偏置与测量难题

深度学习的一个经典谜题是:参数量远多于训练样本的神经网络为何仍能泛化?一个广为接受的解释是“简单性偏置”:面对多个拟合训练数据的函数,训练过程倾向于选择更简单的那个。但如何定义并测量“简单”一直缺乏满意答案。

已有候选指标如参数范数、sharpness、Jacobian范数等,但往往难以同时满足通用性、可量化性和可优化性。参数空间指标可能反映参数化方式而非函数本身,函数空间直接拟合多元多项式则面临组合爆炸。

有效阶:从函数切片到可计算指标

团队提出沿数据点之间的插值路径“切开”高维神经网络,用Chebyshev正交多项式拟合每条路径上的输出,再根据各阶系数幅度加权计算有效阶(ED)。理论结果显示,对多元多项式,随机路径几乎必然保留代数阶,因此复杂度排序可被保留。

ED位于函数空间,不依赖参数化,且与数据分布相关,衡量真实数据附近的复杂度。相比只看最高阶,ED对系数连续稳定,对噪声不敏感。

实验:预测泛化与揭示相变

在CIFAR-10上,用27组超参数训练ResNet18和ViT-Tiny,ED与泛化差距的Pearson相关系数达0.99,R²为0.98,优于sharpness(0.94/0.88)。在CLIP ViT的ImageNet微调中,ED保持正相关,而其他指标呈弱相关或负相关。

在grokking现象中,ED在记忆阶段升高,在泛化转折点达到峰值后下降,而参数范数和sharpness未清晰标出相变。这表明ED能追踪模型从记忆到归纳的转变。

优化:将ED作为正则项

由于多项式拟合是最小二乘问题,ED对网络输出有解析梯度,可反向传播。团队将ED作为正则项加入训练目标,不强制线性,只惩罚不必要的高阶变化。

实验覆盖图像、文本、视觉-语言模型微调和强化学习,ED正则带来泛化提升,如CLIP微调中分布内与分布外准确率权衡更优。

边界与展望

论文明确“越简单越好”并非无条件:若最简单特征是shortcut,ED可能同样利用它。ED描述复杂度,不等于正确性或公平性。

路径多项式是分布相关代理,训练时采样额外插值点带来计算开销。未来可探索ED用于选择预训练checkpoint、诊断过拟合,或设计世界模型的自监督任务。

可信度边界

本文基于机器之心报道,核心内容来自ICML 2026论文,但论文细节未经独立验证。关于“早于LeCun团队约一年”的表述为团队声称,需谨慎对待。

核心结论

有效阶为神经网络的简单性提供了可计算、可优化的度量,在预测泛化和提升训练上展现潜力,但其适用边界和与正确性的关系仍需进一步研究。

主报道

机器之心

主报道来源