返回信息流
新闻事件
S信号85
THE DECODER
1 个来源

阿里巴巴发布开源权重模型Qwen3.8-Max,参数达2.4万亿

阿里巴巴发布了旗舰模型Qwen3.8-Max,拥有2.4万亿参数,旨在自主处理长期复杂任务,如复现研究论文和自主设计芯片。团队计划下周发布模型权重。

SynthePulse Insight · AI 深度解读

Qwen3.8-Max:阿里开源旗舰如何用2.4万亿参数挑战长周期自主任务

版本 1 · 1 个来源

阿里发布Qwen3.8-Max,2.4万亿参数、950亿激活,主打多日自主完成复杂任务。内部测试显示其能自主构建软件、复现论文并超越、模拟电商盈利翻倍,但基准为自报,独立验证尚待进行。

  • Qwen3.8-Max总参数2.4万亿,每查询激活950亿,基于Qwen3.5架构,权重计划下周开源。
  • 自主编码案例:16天构建oh-my-cli,产生265次提交、127个PR、151个issue,全程无人工干预。
  • 论文复现案例:约5天、125小时计算,复现全部6项结果,并在AIME24上超越原方法2.7分。
  • 电商模拟:以10万元起步,年终余额416,252元,是启动资金的4倍,比第二名GLM 5.2高38%。
  • 芯片设计:逻辑门从8,298降至678,经OpenROAD布局后芯片面积缩小81%。
  • 内部基准显示其接近或超越Claude Opus 4.8、Fable 5、GPT-5.6 Sol,但均为自报,独立验证待进行。
展开章节目录模型发布与定位

模型发布与定位

8月3日,阿里Qwen团队发布旗舰模型Qwen3.8-Max,总参数2.4万亿,每查询激活950亿,基于Qwen3.5架构。该模型聚焦于独立完成跨多日的复杂任务,而非单次问答。

模型于7月中旬以预览版形式通过Token Plan、Qoder和QoderWork提供,价格为标准价的10%。当时团队已提及2.4万亿参数,并称其排名仅次于Fable 5,但未公布基准。Qwen3.8-Max是Qwen-Max系列首个公开权重的模型。

权重计划于下周在Hugging Face和ModelScope上发布。模型现可通过QwenCloud使用,支持OpenAI Chat Completions格式。

自主编码与论文复现

团队展示了三个自主编码案例。第一个案例中,模型花费16天构建命令行工具oh-my-cli,将用户请求转为GitHub issue,自行分配、编写代码、运行测试并迭代改进。截至2026年7月30日,共产生265次提交、127个PR和151个issue,全程无人工干预。

第二个案例中,模型收到论文《Unified Data Selection for LLM Reasoning》但无起始代码,需复现并改进结果。约5天、125小时计算内,模型编写7,600行代码,运行33次GPU训练任务,复现全部6项主要结果,随后测试18个自身想法,在AIME24数学基准上超越原方法2.7分。

第三个案例为WWW2025多模态对话意图识别挑战赛,526个人类团队参赛。模型在24小时内微调多个中文模型及Qwen2.5-VL-7B,组合投票系统,45次提交中准确率从0.60提升至0.853,超越458个团队。

长周期规划:芯片设计与电商模拟

两个案例测试数百轮交互的长周期任务。芯片设计案例中,模型需设计加密电路,从8,298个逻辑门优化至678个,经过约500次迭代。经OpenROAD自动布局后,芯片面积从106x106微米减至46x46微米,减少81%。团队称模型在数百次迭代后仍进行深层结构修改。

电商模拟案例中,模型在E-Commerce-Bench中模拟基于淘宝和天猫匿名数据的一整年在线零售。起始资金10万元,需并行运营多个店铺,包括采购、与供应商自然语言谈判、定价、退货处理及应对台风等危机。供应商池中隐藏152个骗子,模型需识别。最终余额416,252元,为启动资金的4倍,比第二名GLM 5.2高38%,是前代Qwen3.7-Max的2.5倍以上。模型年初积极投资,假日季净利润超10万元。

多模态能力与基准表现

多模态方面,模型可处理超200页文档和超100小时视频。团队推出RecreationBench基准,要求模型在无源码情况下重建应用,仅通过点击和键盘交互观察,覆盖Ubuntu、macOS、Windows、Android和Web。同时发布Qwen-MM-Plugins扩展库,为现有代理系统添加图像视频处理、视觉工具使用和多模态记忆。

团队公布的基准显示,模型在多个类别接近或超越Claude Opus 4.8、Claude Fable 5和GPT-5.6 Sol。PaperBench得分93为对比中最高,TerminalBench 2.1得分86.6,低于GPT-5.6 Sol的88.8。这些为内部运行结果,独立验证待进行。

团队将长任务能力归因于强化学习训练环境的扩展,涵盖多日工作流、嵌套目录结构和多种代理框架。内部评分指数从0.474升至0.725,最佳性能出现在约4,000个环境时,之后略有下降。

竞争格局与开源竞赛

Qwen3.8-Max的直接竞争对手为月之暗面7月27日发布的Kimi K3,后者为2.8万亿参数的多模态MoE模型,上下文窗口100万token,权重开源。月之暗面还发布了部分基础设施,包括注意力内核、MoE通信库和代理工具。独立测试显示K3在网络能力和复杂数学上远逊于西方顶级模型。

Qwen3.8-Max的发布加剧了中国开源模型竞赛。其权重即将公开,可能进一步推动社区应用。

可信度边界

本报道基于THE DECODER的转述,所有基准和案例结果均为阿里团队自报,独立验证尚未进行。部分数据如提交次数、准确率等来自团队声明,未获第三方确认。

核心结论

Qwen3.8-Max展示了开源模型在长周期自主任务上的潜力,但自报基准和案例需独立验证。其开源权重将促进社区评估,中国开源模型竞争或加速。

主报道

THE DECODER

主报道来源