Qwen 3.8 Max(2.4T)和27B:新的开放权重模型,用于编程和协作
Qwen 3.8 Max是一个庞大的2.4T参数模型,以及一个27B模型,已宣布将开放权重,标志着管理层变动后回归开放模型发布。该模型在自主编程、研究和硬件设计方面展示了突破性能力,尽管有Kimi K3的竞争,仍定位为顶级开放模型。
Qwen 3.8 Max是一个庞大的2.4T参数模型,以及一个27B模型,已宣布将开放权重,标志着管理层变动后回归开放模型发布。该模型在自主编程、研究和硬件设计方面展示了突破性能力,尽管有Kimi K3的竞争,仍定位为顶级开放模型。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
在经历管理层变动和闭源API转向后,阿里Qwen以2.4T参数的Qwen 3.8 Max强势回归开源前沿,承诺下周开放权重,并在编码、智能体和多模态领域对标顶级闭源模型。本文基于发布信息与第三方评测,梳理其能力、定价与市场定位。
在经历去年的“Qwen Exodus”和管理层转向闭源API后,外界曾质疑这一领先开源实验室是否继续发布相关模型。2026年8月3日,阿里Qwen宣布Qwen3.8-Max为“迄今最强模型”,并承诺下周开源权重,同时开源Qwen3.8-27B。
官方公布的关键规格包括:2.4T总参数、1M token上下文窗口、API定价$2/$6每百万输入/输出token(缓存token $0.25),并支持低/中/高推理努力模式,兼容OpenAI和Anthropic协议。第三方汇总称其激活参数约95B(MoE激活率约4%)。
该模型定位为编码、长周期智能体工作和多模态推理,官方宣称具备10+天自主编码、500+轮芯片设计优化、365天电商策略执行等能力,并强调视觉作为执行循环的一部分而非仅输入。
官方列举了多项突破性能力:自主编码方面,构建自进化编码框架并运行多周无人值守;自主研究方面,重建论文管线并运行125小时迭代循环,发明新数据选择方法,超越原论文基准+2.71分。
在数据科学竞赛中,与526个人类团队竞争,24小时内进入前13%(超越87%人类团队);芯片设计方面,完成从RTL到物理布局的全流程,将门数从8298降至678,面积减少81%,并在500MHz下满足时序收敛。
在电商模拟基准(365天运营)中,通过博弈论谈判和库存规划实现4.16倍回报(余额¥416,252);同时发布Qwen-MM-Plugins以扩展多模态能力到现有智能体框架。
独立评测显示强劲表现:Frontend Code Arena排名第4(Elo 1668),仅次于Claude Opus 5 Max(1705)和Kimi K3 Max(1676),与Claude Opus 5 High(1669)基本持平;Vision Arena排名第2(1305),仅落后Claude Fable 5 High 13分。
Vals Index中,Qwen3.8-Max在开源模型中排名第2,总分66.1,与Claude Opus 4.7持平,但测试成本低约2.3倍($2.68 vs $6.17)。SWE-bench得分87.3%,领先GPT-5.5(82.6%)和GLM-5.2(83.3%),但落后Claude Opus 4.8(89.2%)。
Vals还报告了进步速度:Qwen 3.7 Max得分为57.5,3.8 Max为66.1,约2.5个月内提升8.6分,同时价格从$2.50/$7.50降至$2.00/$6.00。另有用户声称Qwen 3.8在Terminal Bench上超越Fable 5,但此为个人观点。
这些数据将Qwen3.8-Max置于与Kimi K3和GLM-5.2等巨型稀疏模型的同一部署类别,而非30B-70B的本地实用层级。观察者认为,这标志着中国开源前沿正直接与西方顶级闭源模型竞争,尤其在编码、智能体工作流和多模态任务上。
发布同时,多个基础设施和应用构建者(如Baseten、Hermes Agent、Command Code)确认支持或集成计划。有用户可视化基准差异,认为“Opus 4.8大部分被3.8-Max覆盖”,但此为个人推断。
需要注意的是,官方宣称的能力(如10+天自主编码、500+轮芯片优化)多为厂商自述,缺乏独立验证;第三方评测虽强,但部分数据来自汇总推文(如ZhihuFrontier),需谨慎对待。
本报告基于Latent Space的汇总报道,其中包含官方公告、第三方评测和个人观点。官方能力宣称(如自主编码天数、芯片设计优化轮数)为厂商自述,未经独立验证;第三方评测数据(如Vals Index、SWE-bench)来自Vals AI等机构,但部分细节(如激活参数、基准分数)源自第三方推文汇总,可信度需进一步核实。
Qwen 3.8 Max以2.4T参数和开源承诺,在编码、智能体和多模态领域展现出与顶级闭源模型竞争的实力,但官方宣称的极端能力仍需独立验证。其快速迭代和降价策略,可能加剧开源与闭源模型的竞争,并推动中国开源前沿的全球影响力。
主报道
主报道来源