AI 接连推翻百年数学猜想,但缺乏发明新理论的能力,世界模型或成关键
近期,AI 系统如 GPT-5.6 Sol 和 Claude Fable 5 帮助数学家推翻了麦克斯韦猜想和雅可比猜想等百年数学猜想,引发对 AI 科学发现能力的讨论。然而,DeepMind 研究员 Tom Zahavy 的立场论文指出,大语言模型缺乏溯因推理能力,难以发明全新理论,并主张构建物理一致的世界模型来弥补这一短板。
近期,AI 系统如 GPT-5.6 Sol 和 Claude Fable 5 帮助数学家推翻了麦克斯韦猜想和雅可比猜想等百年数学猜想,引发对 AI 科学发现能力的讨论。然而,DeepMind 研究员 Tom Zahavy 的立场论文指出,大语言模型缺乏溯因推理能力,难以发明全新理论,并主张构建物理一致的世界模型来弥补这一短板。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当 AI 接连推翻麦克斯韦猜想与雅可比猜想,谷歌 DeepMind 研究员 Tom Zahavy 的旧文《大语言模型无法跳跃》却重新引发热议:AI 擅长演绎与归纳,却缺乏提出全新解释性假设的溯因能力。世界模型能否成为跨越这一鸿沟的关键?
7 月 29 日,三位美国数学家在 arXiv 上传论文《麦克斯韦猜想是错的》,构造反例推翻这一物理学经典猜想。致谢显示,核心思路来自 GPT-5.6 Sol。他们构建了“五电荷三角双锥体”,找到至少 24 个非退化平衡点,远超猜想设定的 16 个上限。
更早的 7 月 20 日,Anthropic 一位数论学家宣布借助 Claude Fable 5 推翻雅可比猜想,陶哲轩随后用 ChatGPT 跟进并公开验证过程。7 月 24 日,他在国际数学家大会上警示数学界正从“证明稀缺”进入“证明过剩”的时代。
在 AI 辅助科学发现的浪潮中,谷歌 DeepMind 研究员、AlphaProof 核心开发者 Tom Zahavy 于 2026 年 1 月撰写的立场论文《大语言模型无法跳跃》被广泛传播。他借用皮尔士的三分法,将推理分为演绎、归纳和溯因,并指出溯因是唯一能生成新前提的推理方式,也是大模型目前的短板。
他以爱因斯坦 1907 年想象自由落体提出等效原理为例,说明这种“具身模拟”依赖身体感觉,而大语言模型如同“高维中文屋”,只能处理物理语言,缺乏对物理对象的感受通道。因此,他认为 AI 需要构建物理一致的世界模型,才能实现“跳跃”。
以麦克斯韦猜想证伪为例,AI 提出了基于既有框架的几何构型,但并未发明新理论或质疑假设体系,因此按 Zahavy 的分类仍属于演绎范畴的高效探索。然而,AI 的建议是数学界 150 年未尝试的方向,不能简单归结为符号搜索。
Zahavy 本人也承认,归纳、演绎与溯因在实践中交织。他回应称,自己的文章并非宣称“LLM 是死路”,而是探讨 AI 达到爱因斯坦式发现还缺什么。
Google DeepMind 主席哈萨比斯提出的“爱因斯坦测试”显示,今天的系统无法在限定知识下独立推出广义相对论。Zahavy 的论文提出世界模型等“具身模拟”方案作为解法。
围绕 sim-real gap,存在三条路径:机器人提供真实物理经验,世界模型提供高保真数字模拟,AlphaEvolve 则用进化式代码生成绕过“物理直觉”。三条路径正在收束:机器人路线用世界模型作为训练环境,进化式搜索也用世界模型代替线下实验。
本文信息主要来自 DeepTech 深科技的分析文章,其中包含对论文、推文和演讲的转述。麦克斯韦猜想证伪的具体细节(如 24 个平衡点)来自论文,但 AI 贡献的描述基于论文致谢;雅可比猜想推翻为 Anthropic 数论学家的宣布,未经独立验证;Zahavy 的论文观点为直接引用。
AI 在演绎和归纳上已取得显著进展,但溯因推理仍是短板。世界模型可能成为连接虚拟与现实的媒介,但能否让 AI 提出人类未想到的问题,仍是未知数。
主报道
主报道来源