Anthropic的Claude Opus 5在多数基准测试中与Fable 5持平或超越,成本却远低于后者
Anthropic的Claude Opus 5以61分领跑人工智能分析智能指数,在分析质量和编码方面胜过Claude Fable 5和GPT-5.6 Sol,同时在较低推理层级上的成本仅为Fable 5的一半。尽管领先,但头部竞争依然激烈。
Anthropic的Claude Opus 5以61分领跑人工智能分析智能指数,在分析质量和编码方面胜过Claude Fable 5和GPT-5.6 Sol,同时在较低推理层级上的成本仅为Fable 5的一半。尽管领先,但头部竞争依然激烈。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Anthropic最新旗舰模型Claude Opus 5在多项基准测试中超越或持平Fable 5,成本却更低。然而,其50%的幻觉率和高推理层级下的性能波动,为高可靠性应用场景埋下隐忧。
根据Artificial Analysis的测试,Claude Opus 5在综合智能指数上以61分位居第一,领先Fable 5(60分)和GPT-5.6 Sol(59分)。该指数整合了九项测试,涵盖知识工作、编码、科学推理和事实准确性。在科学推理方面,Opus 5在“人类最后的考试”中得分为53%,与Fable 5持平;但在物理基准CritPt上,它落后于GPT-5.6 Sol、GPT-5.5 Pro和GPT-5.6 Terra。
Epoch AI的独立测试给出了类似但更保守的结论:Opus 5的整体能力指数为159,略低于Fable 5的161;但在软件工程指数上,两者均为161,并列领先。这表明前沿模型之间的竞争极为激烈,尚无模型能拉开明显差距。
Opus 5在成本上具有明显优势。在智能指数任务中,平均每次任务成本为2.03美元,低于Fable 5的2.75美元。在知识工作基准AA-Briefcase上,Opus 5在“最大”推理层级下每次任务成本为17.79美元,比Fable 5的22.30美元低20%;而在“高”层级下仅需10.41美元,不到Fable 5的一半,且性能仍优于Fable 5。
然而,Opus 5的事实准确性存在短板。在AA-Omniscience基准上,其准确性虽比Opus 4.8提升7分,但仍落后Fable 5。更令人担忧的是,Opus 5在不确定时更频繁地作答,导致幻觉率高达50%,比Opus 4.8上升14个百分点。这一缺陷在高风险应用中可能带来严重问题。
在编码方面,Opus 5在“超高”层级下与Claude Code配合,在Artificial Analysis编码指数上与GPT-5.6 Sol并列第一(67分)。在Terminal-Bench v2.1上,Opus 5在“最大”层级下得分89%,与GPT-5.6 Sol持平。
但Vals.ai的测试显示,Opus 5在“高”推理层级下编码性能最佳(89.8%),而“超高”和“最大”层级反而下降至约88.3%-88.4%。原因是最高层级倾向于生成更复杂的解决方案,从而引入更多错误。Terminal-Bench 2.1也呈现类似模式:“高”层级因更高效的时间利用而优于“最大”层级。Anthropic已将“高”设为API和Claude Code的默认层级。
Opus 5在知识工作基准AA-Briefcase上表现尤为突出,在“最大”推理层级下达到1720 Elo,领先Fable 5达146分。其分析质量Elo高达2016,比Fable 5领先近300分。然而,在演示质量上,Opus 5以1628 Elo落后于GPT-5.6 Sol的1666分。
性能提升伴随着时间成本:在“最大”层级下,Opus 5每次任务平均耗时超过36分钟,执行103次传递,比Opus 4.8的24分钟和55次传递长约50%。
本文主要依赖Artificial Analysis和Epoch AI的基准测试数据,这些机构与Anthropic有合作或独立测试关系。所有性能数据均来自公开报告,但幻觉率等指标可能因测试方法不同而有所差异。
Claude Opus 5在性能和成本上均具竞争力,但50%的幻觉率和高推理层级下的性能波动表明,它并非在所有场景下都是最佳选择。用户应根据任务需求选择合适的推理层级,并在高可靠性场景中谨慎使用。
主报道
主报道来源