返回信息流
新闻事件
量子位
1 个来源

清华与腾讯提出TRACE框架:优化LLM后训练中的rollout预算分配

清华大学与腾讯混元团队联合提出TRACE框架,通过将Agent轨迹视为树状结构,主动将rollout预算分配给最可能产生成功/失败对比的节点,从而在相同预算下提升强化学习后训练效率。实验表明,TRACE在数学推理、多跳问答和函数调用任务上稳定超越现有方法,例如在Qwen3-14B的多跳问答中将准确率从51.2%提升至54.0%。

SynthePulse Insight · AI 深度解读

TRACE:把Agent RLVR的rollout预算花在“有分歧”的地方

版本 1 · 1 个来源

清华与腾讯混元团队提出TRACE框架,将Agentic RLVR的rollout预算从平均分配转向结构化分配——优先在可能产生成功/失败对比的根节点和中间前缀上采样,在相同预算下显著提升训练信号密度和最终性能。

  • TRACE是一个面向Agentic RLVR的rollout预算分配框架,核心思想是将Agent轨迹视为树,主动把预算分配给最可能产生成功/失败对比的根节点和中间前缀节点。
  • 在Qwen3-14B的Multi-Hop QA上,TRACE将平均准确率从GRPO的51.2提升到54.0;在Qwen3-8B的DeepScaler数学任务上,有效样本比例从GRPO的26.8%提升到60.6%。
  • TRACE不是新的RL优化器,而是上游的rollout acquisition layer,可接不同的tree-aware policy optimizer。
  • 消融实验表明,根节点分配和前缀分配两者叠加效果最好,单独使用任一阶段均有提升但不如联合使用。
  • 预算形状影响效率:在HotpotQA上,同样总预算2048下,(1024,2)设置(更广根覆盖)优于(512,6)(更深分支)。
  • TRACE在Llama-3.2-3B上同样有效,平均准确率从GRPO的28.5提升到32.3,表明方法可迁移至其他开源模型。
展开章节目录问题:Agentic RLVR中rollout预算的浪费

问题:Agentic RLVR中rollout预算的浪费

在Agentic RLVR中,模型需要多轮思考、调用工具、接收环境反馈,每次完整交互轨迹都是一次rollout。当任务很长、工具调用很多时,rollout预算成为训练瓶颈。更麻烦的是,并非所有rollout都同样有用:如果一组rollout全对或全错,模型很难学到偏好信号。在outcome-only奖励下,训练信号稀疏,信用分配粗糙。

过去的工作主要在prompt层面处理,例如筛选难度适中的问题或分配不同数量的rollout。但在Agent任务中,prompt只是树的根节点,中间前缀(历史状态)同样决定后续成败。TRACE的核心洞察是:rollout预算不应只在prompt层面分配,而应扩展到中间前缀节点。

TRACE方法:两阶段结构化预算分配

TRACE包含两个阶段。Stage 1(全局根分配):在prompt batch中,根据预测的成功概率,跳过或增加采样,使同一prompt的rollout组内更可能同时包含成功和失败。Stage 2(局部前缀扩展):从已采样的中间前缀继续分叉,制造反事实对比——如果原分支成功,则额外分支期望至少一次失败;反之亦然。

TRACE依赖一个共享的prefix value predictor来估计根节点和前缀节点的后续成功概率。预测器在prompt-level和prefix-level均表现出可用的排序相关性,说明历史前缀中包含可学习的局部不确定性信号。

TRACE不是新的RL优化器,而是上游的rollout acquisition layer。它决定采样位置和分叉点,之后可接GRPO、PCL或TreePO等tree-aware policy optimizer。

实验验证:三类任务上的稳定提升

论文在数学推理(DeepScaler)、多跳问答(HotpotQA)和函数调用(BFCL)三类多轮Agentic任务上测试,使用Qwen3-8B和Qwen3-14B作为策略模型。所有方法使用相同rollout预算口径。

主结果:TRACE在相同预算下整体准确率曲线高于GRPO、PCL和TreePO。例如,Qwen3-14B数学推理平均分从GRPO的73.5提升到74.9;多跳QA从51.2提升到54.0;函数调用从46.1提升到48.0。TRACE并非每个单项第一,但平均分更稳,说明提升的是整体训练效率。

有效样本比例(形成成功/失败对比的样本比例)提升显著:在Qwen3-8B DeepScaler任务上,GRPO为26.8%,TRACE达到60.6%;Qwen3-14B上从34.7%提升到59.7%。这证实TRACE的核心收益来自对比构造。

消融与敏感性分析:两个阶段和预算形状都重要

消融实验在Qwen3-8B Multi-Hop QA上进行。只做根节点分配(Stage 1)将有效样本比例从42.8提升到49.1;只做前缀分配(Stage 2)将准确率提升到50.0,有效样本比例到47.3;两者叠加后准确率和有效样本比例均最高。说明Agentic RLVR的预算分配不是单层问题。

预算形状实验显示,同样总预算2048下,(1024,2)设置(更广根覆盖)优于(512,6)(更深分支)。说明rollout效率不只取决于总数,还取决于预算形状。对于多跳问答,更广的根节点覆盖可能更有价值。

局限与意义

TRACE主要面向outcome-only RLVR,如果任务没有清晰可验证的终局奖励,mixed-outcome contrast目标可能需要重新设计。当前实现中,predictor scoring路径的额外计算开销较大,但predictor update本身占比不大。论文认为,当rollout本身非常贵时,花一部分计算去判断哪里更值得rollout是划算的。

TRACE的意义在于将Agentic RLVR的采样问题从“抽多少条”转向“在哪里分叉”。随着Agent任务变长、变开放,平铺式多采样成本失控,TRACE提供了一种在固定预算下更频繁地获得有效训练信号的思路。

可信度边界

本文基于量子位对清华大学与腾讯混元团队研究论文的报道,所有实验数据、方法描述和结论均来自该报道。报道中未提供论文原文链接或预印本地址,因此部分细节(如具体公式推导、完整benchmark表格)无法独立验证。报道中提及的对比方法(GRPO、PCL、TreePO)和实验结果(准确率、有效样本比例)均为来源声明,置信度较高但非一手来源。

核心结论

TRACE通过将rollout预算从平均分配转向结构化分配——优先在可能产生成功/失败对比的根节点和中间前缀上采样——在相同预算下显著提升了Agentic RLVR的训练信号密度和最终性能。这一思路对于长程、多轮Agent任务的后训练具有现实意义。

主报道

量子位

主报道来源