复现ICML 2200篇论文的经验教训
一个研究团队复现了机器学习顶级会议ICML的2200篇论文,并分享了过程中的见解。这项工作凸显了AI研究中可复现性的挑战和重要性。
一个研究团队复现了机器学习顶级会议ICML的2200篇论文,并分享了过程中的见解。这项工作凸显了AI研究中可复现性的挑战和重要性。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
一场由 1,221 名社区成员参与的复现黑客松,对 ICML 2026 的三分之一论文进行了逐条验证,揭示了 AI 研究可复现性的真实图景:51% 的论文至少有一条主张被验证,23% 存在争议,而人类审稿人可能遗漏了关键错误。
ICML 2026 收到 23,918 篇投稿,接受 6,352 篇,几乎是前一年的两倍,呈指数增长,部分由 AI 代理加速实验和写作驱动。然而,审稿能力并未同步提升,审稿人多为志愿者,可能缺乏时间或专业知识。
一位审稿人对一篇被接收的 spotlight 论文自述:“我的低置信度分数是因为我没有仔细检查所有证明。”该论文后来在复现中被发现存在错误,这凸显了传统审稿流程的局限。
AI 代理(如 Claude Code、Codex、Cursor、Pi)现在能阅读论文、编写代码、运行实验并报告结果,使得大规模复现成为可能。这正是本次黑客松的出发点。
2026 年 7 月 15 日至 8 月 2 日,Hugging Face 组织了 ICML 2026 Open Reproductions 挑战。组织者索引了 6,341 篇论文并提取核心科学主张,参与者自带代理(如 Claude Code、Codex、Cursor、orx)进行复现,鼓励多人独立复现同一篇论文。
每次运行生成 Trackio 日志,包含代码、工件和可选的完整代理执行轨迹,确保审计过程本身可审计。自动日志裁判(基于开源模型 GLM-5.2)对每条主张给出“已验证”“证伪”“玩具规模”或“不确定”的判定,并明确将日志的自我评估视为不可信。
参与者获得 20 美元计算积分,共启动 2,962 个云任务。当完整复现不可能时(如数据集专有),参与者使用合成数据运行玩具复现。最终,1,221 名成员加入,发布 6,816 份日志,覆盖 2,226 篇论文(34%),35,908 条主张被判定,274 个完整代理轨迹数据集公开。
按论文聚合主张级判定:51% 的论文(1,103 篇)至少有一条主张被独立验证,其中 266 篇完全复现(所有主张均验证),632 篇部分复现且无证伪。总计 3,978 条主张通过真实实验得到确认。
23% 的论文(496 篇)至少有一条主张被证伪或争议,包括 49 篇全部证伪、242 篇独立团队对相同主张得出相反结论。这显示可复现性并非二元,而是对抗性的。
其余论文中,502 篇仅有玩具规模证据,280 篇因缺失工件(最常见原因)无法判定。
一些论文表现良好,例如“Flat Minima and Generalization”被 20 个独立团队复现,其中 12 个验证了所有主张;“A Coin Flip for Safety”中 17 份日志有 14 份验证了所有主张,讽刺的是该论文主题是 LLM 法官不可靠。
35 名参与者正式声称证伪了某些内容,组织者对抗性重新验证了所有声明。确认的证伪包括:学习增强分页论文声称鲁棒性为 H_k + O(1),但测量显示附加项增长如 0.38 ln k,扩展至 k=1,024 后确认约九西格玛偏差,真实为 H_k + Θ(log k)。
另一个案例是“Attention's forward pass and Frank-Wolfe”定理,声称 token 粒子在原点位于凸包内时坍缩至原点,但三个独立团队发现反例,最早在 t=224 步出现,解释了为何有限时域检查会过早停止。作者当天确认并正在修复。
“Self-Distillation Enables Continual Learning”论文中,中心方程和理论部分分析反向 KL 散度,但发布代码的默认设置(据作者称产生所有结果)计算前向 KL。发现此问题的日志也未能复现论文声称的 +4pp 结果。
这些案例表明,AI 代理驱动的复现能发现人类审稿人可能遗漏的错误,但复现过程本身也充满挑战,如有限时域检查的局限和理论-实现不一致。
该挑战展示了 AI 在科学验证中的潜力,但也提醒我们,可复现性需要对抗性审查和透明日志。
本报告基于 Hugging Face 官方博客(2026 年 8 月 13 日发布),属于第一方来源。所有数字和事件均来自该来源,未引入外部信息。部分结论(如“AI 代理能发现人类遗漏错误”)是基于案例的推断,已在文中标注。
ICML 2026 复现挑战表明,AI 代理可以大规模执行论文复现,但结果呈现对抗性:51% 的论文有验证,23% 有争议。这既展示了 AI 在科学验证中的潜力,也揭示了当前审稿系统的不足,以及复现本身需要谨慎解读。
主报道
主报道来源