返回信息流
新闻事件
A重点79
机器之心
1 个来源

Meta AI 在五项 STEM 奥赛中获得金牌,纯推理成绩引关注

Meta 宣布其 AI 模型在五项 STEM 学科奥林匹克竞赛中取得金牌或金牌水平成绩,其中两项物理竞赛理论考试满分,且全程禁用工具以测试纯推理能力。该模型是 Muse Spark 系列的内部版本,使用了多智能体编排与并行推理。此举被视为 Meta 在大模型竞赛中重新崛起的信号。

SynthePulse Insight · AI 深度解读

Meta 纯推理拿下五项奥赛金牌:是复兴信号,还是标尺失效?

版本 1 · 1 个来源

Meta 宣布其 AI 模型在五项 STEM 奥赛中全部获得金牌或金牌水平成绩,其中两项物理理论满分,且全程禁用工具。这一成绩单在 2026 年的坐标下是否依然耀眼,抑或奥赛作为推理标尺正在失效?

  • Meta 在 𝕏 上宣布,其 AI 模型在五项 STEM 奥赛中全部获得金牌或金牌水平成绩,其中两项物理理论考试满分。
  • Meta 强调纯推理:禁止搜索、编码和计算器,以测试真正的推理能力。
  • 成绩单中 IMO 为金牌,IChO 和 RMM 为“金牌水平表现”,后者暗示未经官方正式评定。
  • Meta 研究者补充,模型来自 Muse Spark 系列内部版本,使用多智能体编排与并行推理,并答对了官方答案错误的问题。
  • 2026 年 IMO 已有华为 Celia 和小红书 dots-note-3.0 获得满分,Meta 的金牌在排位中并不显眼。
  • 奥赛作为推理标尺正在失效:一年内从“难以企及”变为“多家实验室都能刷满”。
展开章节目录成绩单与措辞的微妙差异

成绩单与措辞的微妙差异

Meta 在 𝕏 上宣布,其 AI 模型在五项 STEM 学科奥林匹克竞赛中全部获得金牌或金牌水平成绩,其中亚洲物理奥林匹克竞赛(APhO)和国际物理奥林匹克竞赛(IPhO)的理论考试直接满分。成绩单中,IMO 明确为“金牌”,而 IChO 和 RMM 则写为“金牌水平的表现”。这种措辞通常意味着成绩未经赛事组委会正式评定,而是按当年金牌分数线自行对照得出。Meta 同时感谢了竞赛选手与组委会的支持,暗示部分赛事的参与经过了组委会协调,比 2025 年 OpenAI 自行评分的方式更正式。

Meta 特意强调,为了测试纯粹的推理能力,模型被禁用了所有工具:不能搜索、不能写代码、不能用计算器。这一约束意义重大,因为过去一年里,许多顶尖奥赛成绩依赖“强模型 + 验证器 + 多轮精修”的 agent 流水线。例如,有研究者用 Gemini 3.1 Pro 搭建简单 agent,在 IPhO 2025 理论题上五次满分,但作者也提示数据污染无法排除。Meta 主动放弃这条路径,凸显其纯推理的定位。不过,物理竞赛包含实验考试,Meta 报告的应该仅是理论部分。

从 Llama 到 Muse:Meta 的重建之路

2025 年是 Meta AI 的艰难时期:Llama 4 Maverick 在 Artificial Analysis 智能指数上仅得 18 分,Behemoth 因能力不足推迟,扎克伯格重组并引入 Alexandr Wang 与 Scale AI 团队成立 Meta Superintelligence Labs(MSL),推倒重建预训练、数据和 RL 后训练系统。2026 年 4 月 8 日,MSL 发布 Muse Spark,原生多模态、262k 上下文,智能指数从 18 跃升至 52。7 月 9 日,Muse Spark 1.1 上线,主打 agentic 与编程,成为 Meta 第一个收费 API 模型。本周,基于 Muse Spark 1.2 的终端编程智能体 Muse Code 进入 beta。这份奥赛成绩单更像是下一代 Muse 模型的预告片。

2026 年的坐标:金牌不再稀缺

2025 年 7 月,OpenAI 与 Google DeepMind 双双拿下 IMO 金牌(35/42,六题解出五题)时,OpenAI 研究员称之为“登月时刻”。但一年后,坐标系已变:2026 年 7 月上海 IMO 结束后,华为 Celia 与小红书 dots-note-3.0 先后宣布获得 42/42 满分,小红书称此前从未有大模型在 IMO 官方评审下拿到满分。另有报告称 Anthropic 的 Claude Opus 5 在不使用 agent 框架和工具的条件下一次通过全部六题。因此,Meta 的 IMO 金牌在 2026 年并不显眼,真正有分量的是两项物理理论满分——前提是能被独立验证。

更值得警惕的是,奥赛作为推理能力标尺正在失效。Meta 给出的理由是“为了理解我们在推理上是否取得了真正的进展”,但当同一批竞赛在一年内从“难以企及”变成“多家实验室都能刷满”,这把尺子的信息量急剧衰减。陶哲轩在 2025 年就指出,AI 能做到什么很大程度上取决于测试方法本身。奥赛题有标准答案、明确评分标准和充足历史题库,这些恰恰是现实科研问题不具备的条件。

Meta 支棱起来了吗?

从 Muse Spark 到 Muse Code 再到这份成绩单,Meta 至少不再是那个只能靠开源叙事维持存在感的公司。但要说重回第一梯队,还需要拿出更多东西,尤其是一个真正能被用起来的产品。目前 Meta 尚未发布相关技术博客或研究报告,成绩的独立验证仍是关键。

可信度边界

本文主要基于机器之心对 Meta 官方 𝕏 声明及研究者推文的转述。成绩单中 IMO 为金牌,IChO 和 RMM 为“金牌水平表现”,后者未经官方评定,属于 Meta 自行对照。物理满分仅指理论部分,实验部分未提及。Meta 尚未发布技术报告,独立验证缺失。

核心结论

Meta 的纯推理奥赛成绩单展示了其模型能力的进步,但在 2026 年奥赛标尺失效的背景下,其真正价值取决于能否被独立验证,以及能否转化为实际产品。

主报道

机器之心

主报道来源