Anthropic的Opus 5在旨在衡量真实智能的基准测试中超越Fable 5和GPT-5.6 Sol
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得了30.2%的分数,几乎是GPT-5.6 Sol此前7.8%纪录的四倍。该基准测试的开发者表示,该模型独立推导出了反射方程,这是他们从未在其他模型中见过的行为,并归因于更强的逻辑推理能力。
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得了30.2%的分数,几乎是GPT-5.6 Sol此前7.8%纪录的四倍。该基准测试的开发者表示,该模型独立推导出了反射方程,这是他们从未在其他模型中见过的行为,并归因于更强的逻辑推理能力。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得 30.2% 的分数,几乎是此前纪录保持者 GPT-5.6 Sol 的四倍。ARC Prize 团队将这一领先归因于更强的逻辑推理能力,但独立测试显示其优势可能局限于特定类型的任务。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的分数,几乎是此前纪录保持者 OpenAI GPT-5.6 Sol (Max) 的 7.8% 的四倍。ARC Prize 团队将这一领先归因于“更强的逻辑推理能力,使其能够在陌生环境中进行更自主的探索、规划和执行”。
在测试过程中,Opus 5 展现出研究人员此前从未在 AI 模型中观察到的行为:它能够将任务转化为代数符号,并独立推导反射方程。此外,Opus 5 解决了五个此前未解决的环境,其中四个达到或超过人类水平。
ARC-AGI-3 旨在衡量 AI 模型解决训练中未见过的新任务的能力,这些任务人类通常可以轻松处理。当前版本采用类似游戏的形式,模型必须推断交互环境的规则、规划行动并逐步执行。这测试的是通用推理能力而非存储的知识。
值得注意的是,官方分数仅计算语言模型本身的性能,不包括额外软件(即“ harness ”)的帮助。ARC Prize 认为,未来的 AGI 系统不应需要外部帮助来解决新任务。Opus 5 如果在 Claude Code 中使用,得分可能会更高。
在 Guanghan Ning 的私人基准测试 Witness 上,Opus 5 的得分仅为 43.4,与 Kimi K3 和 Fable 5 统计持平,相比 Opus 4.8 的提升远小于 ARC-AGI-3 上的提升。Ning 指出,这种模式符合针对特定类型数据训练的特征,但 Witness 无法确定 Anthropic 使用了哪些数据。
Greg Kamradt 则认为,一个基于熟悉机制的游戏并不能测试对新颖性的适应能力,而一个弱结果并不能否定模型的整体改进。Witness 本身也是围绕 ARC-AGI-3 风格的谜题设计的,因此更好的表现可能反映了真正的迁移而非记忆。
Ning 后来澄清说,Opus 5 确实在 Witness 上实现了泛化,只是程度远低于 ARC-AGI-3。他将这一过程比作编码基准的演变:作为交互推理的主要目标,ARC-AGI-3 自然会吸引最多的训练努力。覆盖更多边缘情况可能有助于模型泛化到更广泛的抽象推理任务。
Anthropic 尚未解释性能提升的原因,但定向数据标注和强化学习是合理的因素。与早期模型不同,Opus 5 是在 ARC-AGI-3 及其格式公开后开发的,这可能使 Anthropic 能够针对基准的技能和谜题格式进行训练,尽管这并不意味着公司在确切任务上进行了训练。标注者可以标记类似谜题的推理轨迹、有用动作、失败尝试和恢复步骤,强化学习则可以奖励探索、规划、规则发现和自我修正。
本文主要依赖 THE DECODER 的报道,该报道引用了 ARC Prize 的公开结果和分析,以及独立研究者 Guanghan Ning 和 Greg Kamradt 的评论。所有具体数字和结论均来自这些来源,未引入外部知识。部分关于训练策略的讨论属于合理推断。
Claude Opus 5 在 ARC-AGI-3 上的表现确实令人印象深刻,但独立测试表明其优势可能部分源于针对该基准的定向训练。真正的通用推理能力提升仍有待更广泛的验证。
主报道
主报道来源