返回信息流
新闻事件
A重点73
机器之心
1 个来源

AI首次拿下IMO官方满分金牌,背后藏着一套自我纠错机制

小红书发布的AI模型dots-note-3.0在第67届国际数学奥林匹克(IMO 2026)中成为首个经官方评阅获得满分42分的AI模型,六道题均获7分。该模型采用自然语言推理与Python辅助分析,通过Proof、Verify、Refine的自我纠错机制完成证明,展现了AI在数学推理上的重大进步。

SynthePulse Insight · AI 深度解读

AI首次IMO满分:42分背后的自我纠错革命

版本 1 · 1 个来源

小红书dots-note-3.0在IMO 2026拿下首个AI官方满分,但真正的突破不在分数,而在其递归自我批判机制——这可能是通往通用智能体的关键一步。

  • dots-note-3.0成为首个经IMO官方评阅取得满分的AI模型,六道题均获7分,总分42分。
  • 解题流程包含Proof、Verify、Refine三个环节,实现递归自我批判,不依赖形式化系统。
  • 第三题采用归纳法而非常见图论思路,展示自主探索能力。
  • 团队推出VibeAgentBench,覆盖10个生活领域,任务中位时长29天,最长111天,探索长程任务评估。
  • IMO满分被视为阶段验证,下一目标是更模糊、更长期的生活任务。
展开章节目录满分背后的意义

满分背后的意义

在IMO 2026上,dots-note-3.0提交的六道题均获7分,成为首个经IMO官方评阅取得满分的AI模型。此前谷歌Gemini Deep Think在IMO 2025解出5道题,以35分达到金牌标准。今年全球共有7名人类选手获得满分,包括中国队的邓乐言、刘澈、张柏伦。

满分42分的价值在于六份完整证明经得起逐步检查。证明题不同于计算题,结论正确但推理可能有漏洞,IMO要求提交自然语言证明,专业评阅能暴露长链条推理中的隐藏问题。

递归自我批判机制

dots-note-3.0的解题流程包含Proof、Verify、Refine三个环节:Proof生成候选证明,Verify检查漏洞并给出建议,Refine根据反馈修改并整合方案。完成一轮后可再次进入检查,实现多次修正。

该机制不依赖Lean等形式化系统,直接读取LaTeX题目,以自然语言推理结合Python辅助分析,以Agentic方式端到端解题。团队称之为“递归自我批判”,并视为递归自我改进(RSI)的前提。

自主探索与证明创新

在第三题(组合数学博弈与极值证明)中,人类选手常见做法是转换为图论连通性问题,而dots-note-3.0选择归纳法:设计按倍数递减的木段,通过归纳证明无论项羽如何落刀,刘邦失去的总长度受同一上限约束。

这显示模型具备一定自主探索能力,能绕开常见思路找到更简洁的证明路径。但思路巧妙不等于满分,评委检查整份证明,漏掉边界条件或关键推导仍会失分。

从IMO到生活任务

IMO属于短程、可验证任务,有明确评阅规则。生活任务则更长更模糊,如装修、旅行、求职等,步骤多、需求变化,没有统一评分标准。

团队构建VibeAgentBench,覆盖旅行、理财、诉讼、装修等10个领域,共200个任务,接入22个模拟服务后端和288个工具接口。任务中位持续29天,最长约111天,通过7453个脚本事件和超1.2万条检查标准评估Agent能力。

这些任务与IMO都考验模型提出方案后根据反馈检查修正的能力。生活场景中模型需审视更广:是否理解用户、哪些偏好值得保留、哪些需求已变化。

能力分界线的转移

过去评价大模型关注首次回答质量,现在随着任务变长变复杂,模型能否在执行中停下来检查、发现偏差并及时修正,成为新的能力分界线。

dots-note-3.0的IMO满分被视为阶段性验证,证明模型能在边界清晰、结果可验证的任务中完成检查纠错闭环。下一场考试没有固定考期,也没有标准答案。

可信度边界

本文信息主要来自机器之心报道,其中IMO成绩、模型机制等为报道方陈述,未获官方独立验证。部分细节如具体证明方法来自第三方人士(如CMO金牌得主汪千桐)的说法,属于来源声明。

核心结论

dots-note-3.0的IMO满分不仅是技术突破,更标志着AI从单次生成向自我纠错、递归改进的范式转变,为长程复杂任务铺路。

主报道

机器之心

主报道来源