返回信息流
新闻事件
S信号86
DeepTech深科技
1 个来源

AI 接连推翻百年数学猜想,但缺乏发明新理论的能力,世界模型或成关键

近期,AI 系统如 GPT-5.6 Sol 和 Claude Fable 5 帮助数学家推翻了麦克斯韦猜想和雅可比猜想等百年数学猜想,引发对 AI 科学发现能力的讨论。然而,DeepMind 研究员 Tom Zahavy 的立场论文指出,大语言模型缺乏溯因推理能力,难以发明全新理论,并主张构建物理一致的世界模型来弥补这一短板。

SynthePulse Insight · AI 深度解读

AI 证伪百年猜想,却难发明新理论:世界模型能否补齐“溯因”短板?

版本 1 · 1 个来源

当 AI 接连推翻麦克斯韦猜想与雅可比猜想,谷歌 DeepMind 研究员 Tom Zahavy 的旧文《大语言模型无法跳跃》却重新引发热议:AI 擅长演绎与归纳,却缺乏提出全新解释性假设的溯因能力。世界模型能否成为跨越这一鸿沟的关键?

  • 7 月 29 日,三位美国数学家借助 GPT-5.6 Sol 构造反例,推翻麦克斯韦猜想,找到至少 24 个非退化平衡点,远超 16 个上限。
  • 7 月 20 日,Anthropic 数论学家宣布借助 Claude Fable 5 推翻雅可比猜想,陶哲轩随后用 ChatGPT 跟进验证。
  • Tom Zahavy 在 2026 年 1 月的论文中提出,大语言模型缺乏溯因推理,即从反常现象倒推新解释的能力,这是发明新理论的关键。
  • Zahavy 认为,构建物理一致的世界模型是弥合这一鸿沟的关键,并提及 Genie 系列作为可能路径。
  • 三条路径(机器人、世界模型、进化式搜索)正在收束,世界模型可能成为连接虚拟与现实的媒介。
展开章节目录AI 接连证伪百年猜想

AI 接连证伪百年猜想

7 月 29 日,三位美国数学家在 arXiv 上传论文《麦克斯韦猜想是错的》,构造反例推翻这一物理学经典猜想。致谢显示,核心思路来自 GPT-5.6 Sol。他们构建了“五电荷三角双锥体”,找到至少 24 个非退化平衡点,远超猜想设定的 16 个上限。

更早的 7 月 20 日,Anthropic 一位数论学家宣布借助 Claude Fable 5 推翻雅可比猜想,陶哲轩随后用 ChatGPT 跟进并公开验证过程。7 月 24 日,他在国际数学家大会上警示数学界正从“证明稀缺”进入“证明过剩”的时代。

《大语言模型无法跳跃》的论点

在 AI 辅助科学发现的浪潮中,谷歌 DeepMind 研究员、AlphaProof 核心开发者 Tom Zahavy 于 2026 年 1 月撰写的立场论文《大语言模型无法跳跃》被广泛传播。他借用皮尔士的三分法,将推理分为演绎、归纳和溯因,并指出溯因是唯一能生成新前提的推理方式,也是大模型目前的短板。

他以爱因斯坦 1907 年想象自由落体提出等效原理为例,说明这种“具身模拟”依赖身体感觉,而大语言模型如同“高维中文屋”,只能处理物理语言,缺乏对物理对象的感受通道。因此,他认为 AI 需要构建物理一致的世界模型,才能实现“跳跃”。

反例是 AI 的发明吗?

以麦克斯韦猜想证伪为例,AI 提出了基于既有框架的几何构型,但并未发明新理论或质疑假设体系,因此按 Zahavy 的分类仍属于演绎范畴的高效探索。然而,AI 的建议是数学界 150 年未尝试的方向,不能简单归结为符号搜索。

Zahavy 本人也承认,归纳、演绎与溯因在实践中交织。他回应称,自己的文章并非宣称“LLM 是死路”,而是探讨 AI 达到爱因斯坦式发现还缺什么。

世界模型与三条路径的收束

Google DeepMind 主席哈萨比斯提出的“爱因斯坦测试”显示,今天的系统无法在限定知识下独立推出广义相对论。Zahavy 的论文提出世界模型等“具身模拟”方案作为解法。

围绕 sim-real gap,存在三条路径:机器人提供真实物理经验,世界模型提供高保真数字模拟,AlphaEvolve 则用进化式代码生成绕过“物理直觉”。三条路径正在收束:机器人路线用世界模型作为训练环境,进化式搜索也用世界模型代替线下实验。

可信度边界

本文信息主要来自 DeepTech 深科技的分析文章,其中包含对论文、推文和演讲的转述。麦克斯韦猜想证伪的具体细节(如 24 个平衡点)来自论文,但 AI 贡献的描述基于论文致谢;雅可比猜想推翻为 Anthropic 数论学家的宣布,未经独立验证;Zahavy 的论文观点为直接引用。

核心结论

AI 在演绎和归纳上已取得显著进展,但溯因推理仍是短板。世界模型可能成为连接虚拟与现实的媒介,但能否让 AI 提出人类未想到的问题,仍是未知数。

主报道

DeepTech深科技

主报道来源