Anthropic 发布 Claude Opus 5
Anthropic 宣布推出 Claude Opus 5,这是其 Opus 层级 AI 模型的一次重大升级。新模型旨在支持长时间运行的智能体,并在编程和专业工作方面带来显著改进。
Anthropic 宣布推出 Claude Opus 5,这是其 Opus 层级 AI 模型的一次重大升级。新模型旨在支持长时间运行的智能体,并在编程和专业工作方面带来显著改进。
SynthePulse Insight · AI 深度解读
版本 1 · 2 个来源
Anthropic 发布 Claude Opus 5,宣称以 Fable 5 一半的价格提供接近其能力,并在多项基准上创下新纪录,同时加强了网络安全防护。
Claude Opus 5 在多个基准上达到或接近前沿水平。在 Frontier-Bench v0.1 上,它超越所有其他模型,性能是 Opus 4.8 的两倍以上,且每任务成本更低。在 CursorBench 3.2 上,最大努力设置下,其性能在 Fable 5 峰值的 0.5% 以内,但每任务成本仅为一半。在 ARC-AGI 3 上,其得分是次优模型的三倍。在 Zapier AutomationBench 上,通过率约为次优模型的 1.5 倍,且即使最低努力设置也超过其他模型。在 OSWorld 2.0 上,它以 Fable 5 最佳结果三分之一多一点的成本超越了所有模型。
定价与 Opus 4.8 相同(输入 $5/百万 token,输出 $25/百万 token),为 Fable 5 的一半,且略低于 OpenAI 的 GPT-5.6。Anthropic 还推出了“快速模式”(研究预览),速度翻倍但价格翻倍。
此次发布发生在 Anthropic 与美国政府最新一轮交锋数周后,以及 OpenAI 安全事件数天后。此前,Fable 5 和 Mythos 5 因政府担忧而被下线数周,重新上线时加强了网络安全防护。Anthropic 表示 Opus 5 是“最对齐的 Opus 模型”,不易被诱导滥用,并比 Opus 4.8 有更强的网络安全防护。发言人 Danielle Ghiglieri 称公司继续与政府合作进行独立测试。
Anthropic 报告了多个早期测试案例:在 Frontier-Bench 任务中,Opus 5 被要求从图纸重建 3D 模型,但无法直接查看图纸,它自主编写计算机视觉管线从像素中提取几何信息并成功重建,而其他模型五次尝试均失败。在修复流行开源包管理器的 bug 时,Opus 5 找到了根本原因并修复了社区补丁遗漏的边缘情况,而竞争模型仅修复了表面症状。一位交易公司工程师使用 Opus 5 在一个会话中构建了新交易所的市场数据馈送,Opus 5 甚至自行构建测试工具验证代码。
早期客户反馈包括:在 Devin 中,Opus 5 在困难调试和根因分析任务上表现突出;在 Zapier AutomationBench 上,它端到端运行了完整的客户流失预防序列,通过率达 100%;在基因组学分析中,它像细心的科学家一样选择正确的统计检验并交叉验证结果。
本文主要基于 Anthropic 官方新闻稿和 The Verge 的报道。性能数据来自 Anthropic 内部评估,未经独立验证。早期测试案例由 Anthropic 和其早期访问客户提供,可能具有选择性。
Claude Opus 5 以更低价格提供了接近前沿的能力,并在自主性和可靠性上展现出显著进步,但其网络安全性能仍落后于 Mythos 5,且发布时机受到近期政府监管和安全事件的影响。
主报道
主报道来源
另有 2 个来源报道