清华与腾讯提出TRACE框架:优化LLM后训练中的rollout预算分配
清华大学与腾讯混元团队联合提出TRACE框架,通过将Agent轨迹视为树状结构,主动将rollout预算分配给最可能产生成功/失败对比的节点,从而在相同预算下提升强化学习后训练效率。实验表明,TRACE在数学推理、多跳问答和函数调用任务上稳定超越现有方法,例如在Qwen3-14B的多跳问答中将准确率从51.2%提升至54.0%。
清华大学与腾讯混元团队联合提出TRACE框架,通过将Agent轨迹视为树状结构,主动将rollout预算分配给最可能产生成功/失败对比的节点,从而在相同预算下提升强化学习后训练效率。实验表明,TRACE在数学推理、多跳问答和函数调用任务上稳定超越现有方法,例如在Qwen3-14B的多跳问答中将准确率从51.2%提升至54.0%。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
清华与腾讯混元团队提出TRACE框架,将Agentic RLVR的rollout预算从平均分配转向结构化分配——优先在可能产生成功/失败对比的根节点和中间前缀上采样,在相同预算下显著提升训练信号密度和最终性能。
在Agentic RLVR中,模型需要多轮思考、调用工具、接收环境反馈,每次完整交互轨迹都是一次rollout。当任务很长、工具调用很多时,rollout预算成为训练瓶颈。更麻烦的是,并非所有rollout都同样有用:如果一组rollout全对或全错,模型很难学到偏好信号。在outcome-only奖励下,训练信号稀疏,信用分配粗糙。
过去的工作主要在prompt层面处理,例如筛选难度适中的问题或分配不同数量的rollout。但在Agent任务中,prompt只是树的根节点,中间前缀(历史状态)同样决定后续成败。TRACE的核心洞察是:rollout预算不应只在prompt层面分配,而应扩展到中间前缀节点。
TRACE包含两个阶段。Stage 1(全局根分配):在prompt batch中,根据预测的成功概率,跳过或增加采样,使同一prompt的rollout组内更可能同时包含成功和失败。Stage 2(局部前缀扩展):从已采样的中间前缀继续分叉,制造反事实对比——如果原分支成功,则额外分支期望至少一次失败;反之亦然。
TRACE依赖一个共享的prefix value predictor来估计根节点和前缀节点的后续成功概率。预测器在prompt-level和prefix-level均表现出可用的排序相关性,说明历史前缀中包含可学习的局部不确定性信号。
TRACE不是新的RL优化器,而是上游的rollout acquisition layer。它决定采样位置和分叉点,之后可接GRPO、PCL或TreePO等tree-aware policy optimizer。
论文在数学推理(DeepScaler)、多跳问答(HotpotQA)和函数调用(BFCL)三类多轮Agentic任务上测试,使用Qwen3-8B和Qwen3-14B作为策略模型。所有方法使用相同rollout预算口径。
主结果:TRACE在相同预算下整体准确率曲线高于GRPO、PCL和TreePO。例如,Qwen3-14B数学推理平均分从GRPO的73.5提升到74.9;多跳QA从51.2提升到54.0;函数调用从46.1提升到48.0。TRACE并非每个单项第一,但平均分更稳,说明提升的是整体训练效率。
有效样本比例(形成成功/失败对比的样本比例)提升显著:在Qwen3-8B DeepScaler任务上,GRPO为26.8%,TRACE达到60.6%;Qwen3-14B上从34.7%提升到59.7%。这证实TRACE的核心收益来自对比构造。
消融实验在Qwen3-8B Multi-Hop QA上进行。只做根节点分配(Stage 1)将有效样本比例从42.8提升到49.1;只做前缀分配(Stage 2)将准确率提升到50.0,有效样本比例到47.3;两者叠加后准确率和有效样本比例均最高。说明Agentic RLVR的预算分配不是单层问题。
预算形状实验显示,同样总预算2048下,(1024,2)设置(更广根覆盖)优于(512,6)(更深分支)。说明rollout效率不只取决于总数,还取决于预算形状。对于多跳问答,更广的根节点覆盖可能更有价值。
TRACE主要面向outcome-only RLVR,如果任务没有清晰可验证的终局奖励,mixed-outcome contrast目标可能需要重新设计。当前实现中,predictor scoring路径的额外计算开销较大,但predictor update本身占比不大。论文认为,当rollout本身非常贵时,花一部分计算去判断哪里更值得rollout是划算的。
TRACE的意义在于将Agentic RLVR的采样问题从“抽多少条”转向“在哪里分叉”。随着Agent任务变长、变开放,平铺式多采样成本失控,TRACE提供了一种在固定预算下更频繁地获得有效训练信号的思路。
本文基于量子位对清华大学与腾讯混元团队研究论文的报道,所有实验数据、方法描述和结论均来自该报道。报道中未提供论文原文链接或预印本地址,因此部分细节(如具体公式推导、完整benchmark表格)无法独立验证。报道中提及的对比方法(GRPO、PCL、TreePO)和实验结果(准确率、有效样本比例)均为来源声明,置信度较高但非一手来源。
TRACE通过将rollout预算从平均分配转向结构化分配——优先在可能产生成功/失败对比的根节点和中间前缀上采样——在相同预算下显著提升了Agentic RLVR的训练信号密度和最终性能。这一思路对于长程、多轮Agent任务的后训练具有现实意义。
主报道
主报道来源