返回信息流
新闻事件
A重点71
Latent Space
1 个来源

Qwen 3.8 Max(2.4T)和27B:新的开放权重模型,用于编程和协作

Qwen 3.8 Max是一个庞大的2.4T参数模型,以及一个27B模型,已宣布将开放权重,标志着管理层变动后回归开放模型发布。该模型在自主编程、研究和硬件设计方面展示了突破性能力,尽管有Kimi K3的竞争,仍定位为顶级开放模型。

SynthePulse Insight · AI 深度解读

Qwen 3.8 Max:2.4T开源巨兽的回归与竞争格局

版本 1 · 1 个来源

在经历管理层变动和闭源API转向后,阿里Qwen以2.4T参数的Qwen 3.8 Max强势回归开源前沿,承诺下周开放权重,并在编码、智能体和多模态领域对标顶级闭源模型。本文基于发布信息与第三方评测,梳理其能力、定价与市场定位。

  • Qwen 3.8 Max为2.4T参数旗舰模型,API定价$2/$6每百万token,承诺下周开源,同时开源27B版本。
  • 官方宣称支持10+天自主编码、500+轮芯片设计优化、365天电商策略,并集成原生多模态视觉反馈。
  • 第三方评测显示其在Frontend Code Arena排名第4(Elo 1668),Vision Arena第2,Vals Index开源模型中第2。
  • Vals Index得分66.1,与Claude Opus 4.7持平,但测试成本低约2.3倍($2.68 vs $6.17)。
  • SWE-bench得分87.3%,领先GPT-5.5和GLM-5.2,但落后Claude Opus 4.8(89.2%)。
  • 相比Qwen 3.7 Max,Vals Index提升8.6分(57.5→66.1),用时约2.5个月,同时降价。
展开章节目录发布背景与核心规格

发布背景与核心规格

在经历去年的“Qwen Exodus”和管理层转向闭源API后,外界曾质疑这一领先开源实验室是否继续发布相关模型。2026年8月3日,阿里Qwen宣布Qwen3.8-Max为“迄今最强模型”,并承诺下周开源权重,同时开源Qwen3.8-27B。

官方公布的关键规格包括:2.4T总参数、1M token上下文窗口、API定价$2/$6每百万输入/输出token(缓存token $0.25),并支持低/中/高推理努力模式,兼容OpenAI和Anthropic协议。第三方汇总称其激活参数约95B(MoE激活率约4%)。

该模型定位为编码、长周期智能体工作和多模态推理,官方宣称具备10+天自主编码、500+轮芯片设计优化、365天电商策略执行等能力,并强调视觉作为执行循环的一部分而非仅输入。

官方宣称的能力亮点

官方列举了多项突破性能力:自主编码方面,构建自进化编码框架并运行多周无人值守;自主研究方面,重建论文管线并运行125小时迭代循环,发明新数据选择方法,超越原论文基准+2.71分。

在数据科学竞赛中,与526个人类团队竞争,24小时内进入前13%(超越87%人类团队);芯片设计方面,完成从RTL到物理布局的全流程,将门数从8298降至678,面积减少81%,并在500MHz下满足时序收敛。

在电商模拟基准(365天运营)中,通过博弈论谈判和库存规划实现4.16倍回报(余额¥416,252);同时发布Qwen-MM-Plugins以扩展多模态能力到现有智能体框架。

第三方评测与排名

独立评测显示强劲表现:Frontend Code Arena排名第4(Elo 1668),仅次于Claude Opus 5 Max(1705)和Kimi K3 Max(1676),与Claude Opus 5 High(1669)基本持平;Vision Arena排名第2(1305),仅落后Claude Fable 5 High 13分。

Vals Index中,Qwen3.8-Max在开源模型中排名第2,总分66.1,与Claude Opus 4.7持平,但测试成本低约2.3倍($2.68 vs $6.17)。SWE-bench得分87.3%,领先GPT-5.5(82.6%)和GLM-5.2(83.3%),但落后Claude Opus 4.8(89.2%)。

Vals还报告了进步速度:Qwen 3.7 Max得分为57.5,3.8 Max为66.1,约2.5个月内提升8.6分,同时价格从$2.50/$7.50降至$2.00/$6.00。另有用户声称Qwen 3.8在Terminal Bench上超越Fable 5,但此为个人观点。

市场定位与竞争格局

这些数据将Qwen3.8-Max置于与Kimi K3和GLM-5.2等巨型稀疏模型的同一部署类别,而非30B-70B的本地实用层级。观察者认为,这标志着中国开源前沿正直接与西方顶级闭源模型竞争,尤其在编码、智能体工作流和多模态任务上。

发布同时,多个基础设施和应用构建者(如Baseten、Hermes Agent、Command Code)确认支持或集成计划。有用户可视化基准差异,认为“Opus 4.8大部分被3.8-Max覆盖”,但此为个人推断。

需要注意的是,官方宣称的能力(如10+天自主编码、500+轮芯片优化)多为厂商自述,缺乏独立验证;第三方评测虽强,但部分数据来自汇总推文(如ZhihuFrontier),需谨慎对待。

可信度边界

本报告基于Latent Space的汇总报道,其中包含官方公告、第三方评测和个人观点。官方能力宣称(如自主编码天数、芯片设计优化轮数)为厂商自述,未经独立验证;第三方评测数据(如Vals Index、SWE-bench)来自Vals AI等机构,但部分细节(如激活参数、基准分数)源自第三方推文汇总,可信度需进一步核实。

核心结论

Qwen 3.8 Max以2.4T参数和开源承诺,在编码、智能体和多模态领域展现出与顶级闭源模型竞争的实力,但官方宣称的极端能力仍需独立验证。其快速迭代和降价策略,可能加剧开源与闭源模型的竞争,并推动中国开源前沿的全球影响力。

主报道

Latent Space

主报道来源