返回信息流
新闻事件
机器之心
1 个来源

蚂蚁集团发布全球首个大规模Agentic扩散模型LLaDA2.2

蚂蚁集团正式发布并开源了LLaDA2.2,这是全球首个大规模Agentic扩散模型。该模型通过引入四种原子操作(保留、替换、删除、插入),解决了传统扩散语言模型无法处理序列长度变化的问题,使其能够胜任智能体任务。这一突破标志着扩散语言模型技术路线迈入新阶段,为AI智能体应用提供了新的基础模型选择。

SynthePulse Insight · AI 深度解读

LLaDA2.2:扩散语言模型首次真正具备Agent能力,效率与性能双突破

版本 1 · 1 个来源

蚂蚁集团发布并开源全球首个大规模Agentic扩散模型LLaDA2.2,通过Levenshtein编辑和强化学习,解决了扩散模型在长程任务中的结构性缺陷,在Agent基准上与顶尖自回归模型持平,吞吐量达1.64倍。

  • LLaDA2.2是全球首个大规模Agentic扩散模型,已开源。
  • 引入Levenshtein编辑(KEEP、SUBSTITUTE、DELETE、INSERT),使扩散模型首次具备动态修改序列长度的能力。
  • L-EBPO强化学习方法让环境反馈驱动编辑决策,从轨迹层面阻断错误传播。
  • 原生支持128K上下文,通过分阶段训练和Block Routing MoE实现。
  • 在7项Agent基准上平均53.83,与自回归模型Ling-2.6-flash的55.74相近,在τ²-Bench等任务上领先。
  • BF16吞吐量达Ling-2.6-flash的1.64倍,FP8量化后额外提升18.6%。
展开章节目录从静态生成到动态修正:Levenshtein编辑打破长度刚性

从静态生成到动态修正:Levenshtein编辑打破长度刚性

传统扩散模型(如LLaDA2.1)的编辑能力仅限于等长替换(KEEP和SUBSTITUTE),无法处理删除冗余或插入新内容的结构性缺陷。LLaDA2.2将动作空间扩展为四种原子操作:KEEP、SUBSTITUTE、DELETE、INSERT,其中DELETE和INSERT通过编辑控制token改变序列长度。这是业界首次将Levenshtein编辑大规模集成进扩散模型的去噪过程。

监督信号通过计算模型草稿与ground truth的最长公共子序列(LCS)推导:匹配锚点标为KEEP,空隙内对齐位置标为SUBSTITUTE,草稿多余标为DELETE,目标多余标为INSERT。消融实验显示,在SWE-bench Verified上,启用Levenshtein编辑后得分从35.8提升至44.4,绝对提升8.6个百分点。

L-EBPO:环境反馈驱动的编辑策略优化

LLaDA2.2提出基于Levenshtein编辑证据下界的分块策略优化方法(L-EBPO),将多轮交互中的编辑决策建模为强化学习问题。外层EBPO优化轨迹级决策,内层管理块内拼接编辑,通过扩展动作空间将两层统一到同一目标函数下。

奖励信号完全来自环境反馈,由工具调用执行正确性、输出格式合法性、任务整体完成度三项相加构成。这使模型的编辑策略被环境校准,而非依赖预设规则,从轨迹层面阻断错误在长程交互中的传播。

128K原生上下文与Block Routing MoE

LLaDA2.2从LLaDA2.1的8K上下文扩展到128K,跨度16倍。采用分阶段训练:先在64K长度上续训300B token,再扩展到128K续训200B token。训练数据以长文档和仓库级代码为主,采用文档感知的packing与注意力边界,避免无关文档相互干扰。Agent数据在128K阶段才加入。

针对块扩散MoE的负载问题,采用Block Routing设计:路由单元与扩散生成单元对齐,通过token racing策略计算块级准入分数,每个块固定容量专家池,上界为O(C)。技术报告称后训练后切换到block routing对模型质量几乎没有损害。

Agent与通用基准评测:与自回归模型正面竞技

评测覆盖17个基准(7个Agent类、10个通用类),与同参数自回归模型Ling-2.6-flash比较。7项Agent基准上,LLaDA2.2-flash平均53.83,Ling-2.6-flash为55.74。具体领先项包括:τ²-Bench(80.33 vs 76.36)、PinchBench(81.66 vs 81.30)、MCP-Atlas(46.21 vs 41.12);Claw-Eval基本持平(64.22 vs 64.56)。

通用基准中,LLaDA2.2-flash在LongBench v2上以45.13反超Ling-2.6-flash的42.94,验证了128K上下文扩展的效果。效率方面,BF16平均吞吐量达Ling-2.6-flash的1.64倍,FP8量化后额外提升18.6%。

可信度边界

本文信息主要来源于蚂蚁集团官方发布及技术报告,经机器之心报道。评测结果和性能数据来自官方报告,未经第三方独立验证。

核心结论

LLaDA2.2证明扩散语言模型不仅能胜任Agent任务,还在效率上具有显著优势,为成本敏感的Agent部署提供了新的基础模型选项。

主报道

机器之心

主报道来源