返回信息流
新闻事件
A重点76
THE DECODER
1 个来源

Qwen3.8 Max追平Claude Opus 4.8,但Kimi K3仍以更低价格获得更高分数

阿里巴巴的Qwen3.8 Max在人工智能分析智能指数上得分56分,比上一代Qwen3.7 Max的46分提高了10分。该模型在性能上追平了Claude Opus 4.8,但Kimi K3仍以更低的价格获得更高分数。

SynthePulse Insight · AI 深度解读

Qwen3.8 Max 追平 Claude Opus 4.8,但 Kimi K3 以更低成本领先

版本 1 · 1 个来源

阿里巴巴最新发布的 Qwen3.8 Max 在 Artificial Analysis 智能指数上追平 Claude Opus 4.8,但 Kimi K3 仍以 25% 的成本优势领先。然而,Qwen3.8 Max 的推理成本翻倍,且出现幻觉率上升等回退。

  • Qwen3.8 Max 在 Artificial Analysis 智能指数上得分 56,较前代 Qwen3.7 Max 的 46 分提升 10 分,与 Claude Opus 4.8 持平,但落后于 Kimi K3 的 57 分。
  • Kimi K3 的每任务成本为 0.86 美元,比 Qwen3.8 Max 的 1.14 美元低约 25%,且得分更高。
  • 在 GDPval-AA 基准上,Qwen3.8 Max 得分 1739,超越 Kimi K3 的 1685,但需要 64 步而非 14 步,输入 token 增长 15 倍。
  • Qwen3.8 Max 的 AA-LCR 下降 2 分,AA-Omniscience 下降 10 分,幻觉率从 23% 升至 40%。
展开章节目录智能指数:追平但未超越

智能指数:追平但未超越

据 Artificial Analysis 数据,Qwen3.8 Max 在智能指数上得分 56,较前代 Qwen3.7 Max 的 46 分提升 10 分,与 Claude Opus 4.8 持平,但落后于 Kimi K3 的 57 分。

Kimi K3 的每任务成本为 0.86 美元,比 Qwen3.8 Max 的 1.14 美元低约 25%,且得分更高,显示出更强的性价比。

GDPval-AA:高分背后的代价

在 GDPval-AA 基准上,Qwen3.8 Max 得分 1739,超越 Kimi K3 的 1685,仅次于 Claude Opus 5 的 1852。

然而,这一高分是通过更长的推理链实现的:Qwen3.8 Max 每任务需要 64 步,而 Kimi K3 仅需 14 步;输入 token 增长 15 倍,因为测试在每一步都重新发送完整对话历史。

这导致推理成本显著上升:Qwen3.8 Max 每任务成本 1.14 美元,是 Qwen3.7 Max 的 0.53 美元的两倍多,尽管 token 价格有所下降(输入从 2.50 美元降至 2.00 美元/百万 token,输出从 7.50 美元降至 6.00 美元,缓存命中从 0.50 美元降至 0.25 美元)。

回退与幻觉率上升

与前代相比,Qwen3.8 Max 在 AA-LCR 上下降 2 分,该测试评估模型从长文本中提取信息的能力;AA-Omniscience 下降 10 分,该测试衡量模型回答知识问题或诚实承认无知的准确性。

准确率保持在约 31%,但幻觉率从 23% 跃升至 40%,表明模型更频繁地猜测而非承认不知道。

可信度边界

本文信息主要来源于 Artificial Analysis 的基准测试,由 THE DECODER 报道。所有数据均为来源声明,未经独立验证。

核心结论

Qwen3.8 Max 在智能指数上追平 Claude Opus 4.8,但 Kimi K3 以更低成本提供更高分数。然而,Qwen3.8 Max 的推理成本翻倍,且出现幻觉率上升等回退,表明性能提升伴随代价。

主报道

THE DECODER

主报道来源