千诀科技联合清华团队提出“有效阶”指标,让神经网络简单性可测可优化
千诀科技与清华大学团队合作,提出了一种名为“有效阶”的新指标,用于量化神经网络的简单性偏置。该指标可在真实规模模型上计算,并可直接参与训练优化,为理解神经网络泛化提供了新工具。研究团队称,其方法论视角比Yann LeCun团队的相关研究早约一年,未来有望用于筛选预训练模型和诊断过拟合。
千诀科技与清华大学团队合作,提出了一种名为“有效阶”的新指标,用于量化神经网络的简单性偏置。该指标可在真实规模模型上计算,并可直接参与训练优化,为理解神经网络泛化提供了新工具。研究团队称,其方法论视角比Yann LeCun团队的相关研究早约一年,未来有望用于筛选预训练模型和诊断过拟合。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
千诀科技与清华团队提出“有效阶”(ED)指标,将神经网络的简单性偏置转化为可计算、可优化的工具,并声称比LeCun团队类似研究早约一年。
深度学习的一个经典谜题是:参数量远多于训练样本的神经网络为何仍能泛化?一个广为接受的解释是“简单性偏置”:面对多个拟合训练数据的函数,训练过程倾向于选择更简单的那个。但如何定义并测量“简单”一直缺乏满意答案。
已有候选指标如参数范数、sharpness、Jacobian范数等,但往往难以同时满足通用性、可量化性和可优化性。参数空间指标可能反映参数化方式而非函数本身,函数空间直接拟合多元多项式则面临组合爆炸。
团队提出沿数据点之间的插值路径“切开”高维神经网络,用Chebyshev正交多项式拟合每条路径上的输出,再根据各阶系数幅度加权计算有效阶(ED)。理论结果显示,对多元多项式,随机路径几乎必然保留代数阶,因此复杂度排序可被保留。
ED位于函数空间,不依赖参数化,且与数据分布相关,衡量真实数据附近的复杂度。相比只看最高阶,ED对系数连续稳定,对噪声不敏感。
在CIFAR-10上,用27组超参数训练ResNet18和ViT-Tiny,ED与泛化差距的Pearson相关系数达0.99,R²为0.98,优于sharpness(0.94/0.88)。在CLIP ViT的ImageNet微调中,ED保持正相关,而其他指标呈弱相关或负相关。
在grokking现象中,ED在记忆阶段升高,在泛化转折点达到峰值后下降,而参数范数和sharpness未清晰标出相变。这表明ED能追踪模型从记忆到归纳的转变。
由于多项式拟合是最小二乘问题,ED对网络输出有解析梯度,可反向传播。团队将ED作为正则项加入训练目标,不强制线性,只惩罚不必要的高阶变化。
实验覆盖图像、文本、视觉-语言模型微调和强化学习,ED正则带来泛化提升,如CLIP微调中分布内与分布外准确率权衡更优。
论文明确“越简单越好”并非无条件:若最简单特征是shortcut,ED可能同样利用它。ED描述复杂度,不等于正确性或公平性。
路径多项式是分布相关代理,训练时采样额外插值点带来计算开销。未来可探索ED用于选择预训练checkpoint、诊断过拟合,或设计世界模型的自监督任务。
本文基于机器之心报道,核心内容来自ICML 2026论文,但论文细节未经独立验证。关于“早于LeCun团队约一年”的表述为团队声称,需谨慎对待。
有效阶为神经网络的简单性提供了可计算、可优化的度量,在预测泛化和提升训练上展现潜力,但其适用边界和与正确性的关系仍需进一步研究。
主报道
主报道来源