返回信息流
新闻事件
A重点74
Simon Willison
1 个来源

OpenAI 用 Astra 模型解决十个数学难题

OpenAI 使用其内部模型 Astra 解决了十个长期未解的数学问题,每个问题的花费不到 2000 美元,并公开了 Lean 4 形式化证明和论文。这一进展被视为 AI 在数学研究领域的重要突破,可能推动“大数学”时代的发展。

SynthePulse Insight · AI 深度解读

OpenAI 用不到 2000 美元攻克十年未解数学难题:AI 数学研究的转折点?

版本 1 · 1 个来源

OpenAI 宣称其内部模型 Astra 以极低成本解决了十个长期未解的数学问题,并公开了 Lean 4 形式化证明。这一事件引发数学界的“深蓝时刻”讨论,但成本、透明度和未公开的失败案例仍存疑。

  • OpenAI 使用内部模型 Astra 解决了十个数学问题,这些问题的主要结果至少十年无进展。
  • 每个问题的 token 成本据称低于 2000 美元(按 GPT-5.6 Sol 价格计算)。
  • OpenAI 公开了 Lean 4 形式化证明、论文和 LLM 生成的证明重建 PDF,但未公开提示词。
  • Anthropic 此前用 Claude 和 Mythos Preview 发现密码学弱点,花费 10 万美元 token 费用。
  • 数学家群体反应类似“深蓝时刻”,陶哲轩提出“大数学”愿景,强调人机协作。
  • 未披露有多少问题在花费 2000 美元后仍未解决,这引发对成功率的质疑。
展开章节目录事件核心:OpenAI 的数学突破声明

事件核心:OpenAI 的数学突破声明

2026 年 8 月 1 日,Simon Willison 的博客报道,OpenAI 宣称其“下一个主要模型的内部版本 Astra”解决了十个数学问题,这些问题“主要结果至少十年没有进展”。据称,每个问题的 token 成本低于 2000 美元(按 GPT-5.6 Sol 价格计算)。

OpenAI 在 openai/ten-proofs 仓库中提供了 Lean 4 形式化证明,并发布了一篇描述解决方案的论文,以及一个 LLM 生成的 PDF,其中模型基于未公开的推理轨迹“重建了证明的诞生过程”。

Willison 评论称这是“相当程度的透明度”,但他表示“我想看到他们使用的提示词!”。

成本与透明度:数字背后的疑问

OpenAI 声称每个问题的成本低于 2000 美元,但 Willison 指出:“没有关于他们花了 2000 美元却未解决问题数量的消息。”这暗示成功率可能并非 100%,但未公开具体失败案例。

相比之下,Anthropic 几天前使用 Claude 和 Mythos Preview 发现密码学弱点,花费了 10 万美元的 token 费用,提示词中强调“我们不是在寻找低垂的果实,我们想要真正的研究来发现真正困难的发现”。

OpenAI 的透明度体现在公开形式化证明和论文,但提示词的缺失使得可复现性受限。Willison 的评论表明,提示词是评估研究质量的关键。

数学界的反应:从“深蓝时刻”到“大数学”

Willison 观察到“许多数学家在线经历了一场集体的‘深蓝时刻’”,暗示 AI 在数学上的突破类似于深蓝击败国际象棋冠军的历史性时刻。

他引用了陶哲轩在 6 月 IEEE Spectrum 中的观点:陶哲轩既不轻视 AI 也不恐惧,而是将其视为学科根本性转变的催化剂,即“大数学”——大规模、去中心化的人机协作,人类负责创造性部分,AI 承担大部分技术性工作。

这一背景为 OpenAI 的结果提供了框架:AI 并非取代数学家,而是作为工具扩展人类能力。

证据链与不确定性

确认的事实:OpenAI 发布了 Lean 4 形式化证明、论文和 LLM 生成的 PDF;Anthropic 花费 10 万美元 token 费用发现密码学弱点;陶哲轩在 IEEE Spectrum 中提出“大数学”概念。

来源声明:OpenAI 声称解决了十个问题,每个成本低于 2000 美元;这些声明来自 OpenAI 的公告,但未经独立验证。

不确定性:未披露失败案例数量;提示词未公开;成本计算基于 GPT-5.6 Sol 价格,但实际 token 使用量未知;数学问题的难度和重要性未详细说明。

可信度边界

本报道基于 Simon Willison 的博客,属于第三方转述。OpenAI 的声明(解决问题数量、成本)为来源声明,未经独立验证。Anthropic 的发现和陶哲轩的引用为来源声明,但陶哲轩的引用来自 IEEE Spectrum 采访,可信度较高。所有数字和结论均来自单一来源,需谨慎对待。

核心结论

OpenAI 的声明展示了 AI 在数学研究中的潜力,但缺乏提示词和失败案例的透明度,使得其可复现性和可靠性存疑。数学界的“深蓝时刻”反应表明,AI 可能正在改变数学研究的范式,但距离陶哲轩所设想的“大数学”还有距离。

主报道

Simon Willison

主报道来源