返回信息流
新闻事件
Claude (X)
6 个来源

Anthropic 发布 Claude Opus 5 模型

Anthropic 发布了 Claude Opus 5,这是一款深思熟虑且主动的 AI 模型,其智能水平接近 Fable 5,但价格仅为后者的一半。该模型在编程和知识工作评估中达到了最先进水平,并在 ARC-AGI-3 测试中得分是次优模型的三倍。Opus 5 即日起在所有付费计划和 Claude API 上可用。

SynthePulse Insight · AI 深度解读

Opus 5:Anthropic 的平衡之道——性能逼近旗舰,价格与管控双降

版本 3 · 8 个来源

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,定位为性能接近旗舰 Fable 5 但价格减半、安全限制更宽松的模型。它在多项基准测试中超越 Fable 5,同时将安全分类器触发频率预期降低 85%,试图在能力、成本与管控之间找到新平衡。

  • Opus 5 API 价格与 Opus 4.8 相同(输入 5 美元/百万 Token,输出 25 美元/百万 Token),仅为 Fable 5 的一半。
  • 在 Frontier-Bench v0.1 上,Opus 5 得分(43.3%)是 Opus 4.8(21.1%)的两倍多,并超过 Fable 5(33.7%)和 GPT-5.6 Sol(34.4%)。
  • ARC-AGI-3 得分 30.2%,是第二名 GPT-5.6 Sol(7.8%)的近四倍,但该结果缺乏 Fable 5 对比,且被部分观察者视为异常值。
  • 安全分类器触发频率预计比 Fable 5 低 85%,但该数据为 Anthropic 预期,实际效果待验证。
  • Opus 5 保留网络安全防护,允许源代码漏洞扫描,但禁止二进制漏洞扫描、渗透测试和 Exploit 生成。
  • 在部分基准测试(如 DeepSWE v1.1)中,Opus 5 落后于 GPT-5.6 Sol;在健康和法律任务上,Fable 5 和 Mythos 5 仍领先。
展开章节目录定价策略:性能对标旗舰,价格维持中端

定价策略:性能对标旗舰,价格维持中端

Opus 5 的 API 定价与 Opus 4.8 完全相同:输入 5 美元/百万 Token,输出 25 美元/百万 Token。这一定价仅为 Fable 5(输入 10 美元/百万 Token,输出 50 美元/百万 Token)的一半。Anthropic 明确将 Opus 5 定位为“接近 Fable 5 前沿智能但价格减半”的模型。

值得注意的是,Anthropic 引入了 Fast 模式,速度提升约 2.5 倍,但价格翻倍。此外,模型提供五个“努力程度”设置(低、中、高、xhigh、max),用户可在性能与 Token 消耗之间权衡。Anthropic 建议在多数场景使用“低”或“中”设置,但编码和代理任务仍推荐从“xhigh”开始。

性能表现:多项基准领先,但非全面碾压

根据 Anthropic 公布的内部基准,Opus 5 在多个评估中创下新高。在 Frontier-Bench v0.1 上,Opus 5 的终端编码得分(43.3%)是 Opus 4.8(21.1%)的两倍多,并超过 Fable 5(33.7%)和 GPT-5.6 Sol(34.4%)。在知识工作基准 GDPval-AA v2 上,Opus 5 的 Elo 评分(1,861)领先于 Fable 5(1,747)和 GPT-5.6 Sol(1,736)。

最引人注目的结果是 ARC-AGI-3,该基准测试模型解决新颖问题的能力,Opus 5 得分 30.2%,是第二名 GPT-5.6 Sol(7.8%)的近四倍。但该测试缺少 Fable 5 的对比数据,且部分观察者认为这一巨大领先优势在实际使用中可能无法复现。

然而,Opus 5 并非在所有测试中领先。在代理编码基准 DeepSWE v1.1 上,GPT-5.6 Sol(72.7%)领先于 Fable 5(69.7%)和 Opus 5(68.8%)。在健康和法律任务上,Fable 5 和 Mythos 5 仍表现更好。此外,在网络安全任务上,Opus 5 在漏洞发现方面接近 Mythos 5,但在漏洞利用开发上明显落后。

安全与对齐:更宽松的管控,更低的触发频率

Anthropic 称 Opus 5 是其“对齐程度最高的模型”,综合失准得分 2.3,表现出最低的鲁莽或欺骗行为率,以及对 Claude 宪法的最强遵守。安全分类器的触发频率预计比 Fable 5 低 85%,这一数字来自 Anthropic 的预期,尚未经独立验证。

在网络安全防护方面,Opus 5 允许源代码漏洞扫描,但禁止二进制漏洞扫描、渗透测试和 Exploit 生成。Anthropic 表示,Opus 5 在网络安全任务上强于 Opus 4.8,但远不及 Mythos 5。当 Claude.ai、Claude Code 和 Claude Cowork 中的请求被阻止时,默认回退到 Opus 4.8,与 Fable 5 的策略相同。

自主能力与工具构建:迭代改进与自我纠错

Anthropic 强调 Opus 5 在检查自身工作并通过迭代改进方面有显著提升。在一个 Frontier-Bench 任务中,Opus 5 收到一张机器零件图纸,但无法直接查看图纸,它通过编写自己的计算机视觉管线从原始像素中提取几何形状,并重建了完整的机器零件。Anthropic 称其他模型在五次尝试后均未解决该任务。

另一个案例中,Opus 5 修复了一个流行开源包管理器中的真实 bug,找到了根本原因并修复了社区补丁遗漏的边缘情况。Anthropic 还提到,一家交易公司的工程师使用 Opus 5 在一次会话中构建了一个新交易所的市场数据馈送,而之前的模型即使有详细计划也无法完成。

可信度边界

本文主要依据 Anthropic 官方发布信息及媒体报道。基准测试成绩、安全分类器触发频率降低 85% 等数据均为 Anthropic 内部数据或预期,缺乏独立第三方验证。ARC-AGI-3 的显著领先缺乏 Fable 5 对比,其实际意义存疑。用户反馈中提及的负面体验(如误操作删除代码库)未获官方证实。

核心结论

Opus 5 是 Anthropic 在性能、成本和管控之间的一次精心平衡:它用 Fable 5 一半的价格提供了接近旗舰的性能,同时大幅降低了安全干预频率。对于大多数开发者而言,Opus 5 可能是比 Fable 5 更实用的选择,但它在部分任务上仍落后于竞品,且其 ARC-AGI-3 的惊人成绩需要更多验证。