返回信息流
新闻事件
A重点85
Artificial Analysis (X)
1 个来源

阿里巴巴发布Qwen3.8 Max,开源计划引发关注

阿里巴巴发布了Qwen3.8 Max,这是一个2.4T参数的MoE模型,在Artificial Analysis Intelligence Index上得分56,与Claude Opus 4.8持平,但落后于Kimi K3。阿里巴巴计划下周开源该模型权重,这将是其最大的开源模型,标志着战略转变。

SynthePulse Insight · AI 深度解读

Qwen3.8 Max 发布:性能跃升但成本与幻觉隐忧并存

版本 1 · 1 个来源

阿里巴巴发布 Qwen3.8 Max,在 Artificial Analysis 智能指数上得分 56,追平 Claude Opus 4.8,但成本翻倍、幻觉率上升,且开放权重策略转变引发关注。

  • Qwen3.8 Max 在 Artificial Analysis 智能指数上得分 56,较前代 Qwen3.7 Max 提升 10 分,与 Claude Opus 4.8 持平,但落后开源权重领先者 Kimi K3 1 分。
  • 模型总参数 2.4T,激活 95B,上下文 1M,支持文本、图像和视频输入,但权重计划下周开放,若兑现将成为阿里最大开源模型。
  • 每任务成本 $1.14,是前代的两倍多,主要因 agentic 评估中更多轮次,而非 token 单价上涨。
  • 在 AA-Omniscience 评估中得分下降 10 分,幻觉率从 23% 升至 40%,显示模型在无法回答时更倾向于尝试而非放弃。
  • GDPval-AA Elo 得分 1739,超越 Kimi K3,但落后于 Claude Opus 5,且部分提升源于每任务轮次增加。
展开章节目录性能跃升:智能指数追平顶级模型

性能跃升:智能指数追平顶级模型

根据 Artificial Analysis 的评测,阿里巴巴新发布的 Qwen3.8 Max 在 Artificial Analysis 智能指数上得分 56,较前代 Qwen3.7 Max 的 46 分提升 10 分,与 Claude Opus 4.8(max,56)持平,在中国实验室中仅次于 Kimi K3(max,57),领先 GLM-5.2(max,51)。

在 GDPval-AA 评估中,Qwen3.8 Max 获得 1739 Elo,较前代提升 468 Elo,超越 Kimi K3(1685),与 Claude Fable 5(1743)和 GPT-5.6 Sol(max,1730)基本持平,仅落后于 Claude Opus 5(max,1852)。

与前代相比,Qwen3.8 Max 在 agentic 评估、科学推理和编码方面均有提升:Terminal-Bench v2.1 提升 6 分,CritPt 提升 7 分,SciCode 提升 4 分,HLE 提升 3 分,GPQA 保持不变。

成本与效率:每任务成本翻倍,但 token 单价下降

Qwen3.8 Max 每智能指数任务成本为 $1.14,是前代 Qwen3.7 Max($0.53)的两倍多,约为 Kimi K3($0.86)的 1.3 倍,GLM-5.2($0.57)的 2 倍。

成本上升主要源于 agentic 评估中更多轮次:GDPval-AA 输入 token 较前代增加约 15 倍,输出 token 使用量增加 45% 至 145M。

尽管每任务成本上升,但 token 单价实际上有所下降:输入/输出价格从 Qwen3.7 Max 的 $2.50/$7.50 降至 $2.00/$6.00,缓存命中价格从 $0.50 降至 $0.25。

隐忧:幻觉率上升与评估异常

在 AA-Omniscience 评估中,Qwen3.8 Max 得分下降 10 分(从 +14 降至 +4),逆转了前代的弃权收益。准确率基本持平于约 31%,但幻觉率从 23% 升至 40%,表明模型在无法回答时更倾向于尝试而非放弃。

此外,τ³-Bench Banking 结果(42%)被认为超出分布,较前代提升 32 分,使 Qwen3.8 Max 在其他评估中领先于得分更高的模型,这一异常值得关注。

AA-LCR 得分下降 2 分,也显示出某些方面的退步。

开放权重策略转变:从闭源到开源

阿里巴巴宣布计划下周发布 Qwen3.8 Max 的权重,这标志着其策略转变,因为其 Max 类模型通常保持专有。

一旦发布,Qwen3.8 Max 将成为阿里巴巴最大的开源权重模型,约为其此前最大开源模型 Qwen3.5 397B 的 6 倍,并成为仅次于 Kimi K3(2.8T)的第二大开源权重模型。

模型总参数 2.4T,激活参数约 95B,上下文窗口 1M,支持文本、图像和视频输入,文本输出。

评测修正与数据可靠性

Artificial Analysis 指出,他们此前发布的 Qwen3.8 Max 得分 53 的结果受到端点间歇性问题影响,已在阿里巴巴公共 API 端点上重新运行所有评估,最终得分为 56。

这一修正提醒我们,第三方评测结果可能受测试环境影响,最终数据应以官方或复测为准。

可信度边界

本报道主要基于 Artificial Analysis 在 X 平台发布的评测数据,属于第三方分析机构,其数据和方法具有一定可信度,但未获阿里巴巴官方确认。部分数据(如成本、参数)来自阿里巴巴官方声明,但权重发布计划等仍属计划性声明,存在不确定性。

核心结论

Qwen3.8 Max 在性能上显著提升,但成本上升和幻觉率增加是主要短板。开放权重策略的转变可能重塑开源模型格局,但需关注其实际发布和后续表现。

主报道

Artificial Analysis (X)

主报道来源