生成模型也能端到端训练了?核心竟是一个for循环
UIUC与哈佛大学的研究者提出了一种名为Explorative Modeling(XM)的新范式,通过一个简单的for循环在训练时生成多个候选样本并选择最接近真实数据的那个进行梯度更新,从而实现了生成模型的端到端训练,解决了暴露偏差和模式模糊问题。该方法有望提升生成模型的表达力,减少对引导技术的依赖。
UIUC与哈佛大学的研究者提出了一种名为Explorative Modeling(XM)的新范式,通过一个简单的for循环在训练时生成多个候选样本并选择最接近真实数据的那个进行梯度更新,从而实现了生成模型的端到端训练,解决了暴露偏差和模式模糊问题。该方法有望提升生成模型的表达力,减少对引导技术的依赖。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
UIUC与哈佛大学提出Explorative Modeling(XM),用3到5行的for循环生成K个候选并只训练最接近真实数据的一个,试图解决生成模型长期存在的暴露偏差与模式模糊问题,并将“探索”验证为独立于参数和数据的第三根缩放轴。
生成模型难以端到端训练,根源在于重构损失在多个合法目标下会取平均值,导致“mode模糊”——最优解恰恰是最不像真实数据的答案。论文指出,直接端到端回归时,三堆散点会被预测成正中间一个点,狗的照片会糊成一团,一句话会退化成重复“the”。
现有模型通过拆分生成过程(自回归一次预测一个元素,扩散一次去一点噪声)来规避mode模糊,但这也使训练和推理采样方式不一致,导致暴露偏差:每一步误差喂进下一步,输入逐渐漂离训练分布。
XM的核心是拆解训练循环:每个训练步生成K个候选,只挑最接近真实数据的一个训练并回传梯度,实现为3到5行的for循环。作者用飞镖比喻解释:允许猜K次且只按最近一次计分时,最优策略是让每次猜测覆盖不同落点,从而抓住多个mode。
论文提出Forward和Reverse两种探索方向:Forward固定真实目标、在生成中搜最近者,偏向查全;Reverse固定生成、在真实数据中搜最近者,偏向查准且几乎不增加算力,但可能塌缩。两者可组合使用。
作者将探索加到扩散/流模型、Jumpy模型和掩码扩散语言模型上,在图像、视频、语言三种模态一致看到性能单调提升。关键数字:数据规模增长时增益从7%升至36%,模型增大时从13%升至23%,算力翻三倍时效率增益翻倍多。
效率上,探索将FLOP效率提升4.1倍、样本效率提升6.2倍、参数效率提升47%。在图像生成上,将RAE配方推到ImageNet无引导FID 1.43。一个探索5个mode的Large模型能跑赢多47%参数但不探索的XLarge模型。
作者解释,小规模时参数和数据是瓶颈,规模放大后生成表达力成为瓶颈,而探索直接放大它。考虑到真实基础模型训练算力比论文最大实验高约四个数量级,这些数字可能只是更大规模下收益的下限。
将XM作为独立端到端模型用于机器人控制:行为克隆中,Explorative Policy只用一次网络前向就追平甚至超过需要100次前向的Diffusion Policy;目标导向世界建模中,Explorative World Model用比Diffuser少16到256倍的推理算力做到更好平均表现。
差距来源:扩散模型在推理时用几百步生成换取表达力,XM把账挪到训练时探索,推理只需一次前向。作者选择在训练时一次探索到位,而非推理时慢慢拆。
第一作者Alexi Gladstone此前主导Energy-Based Transformers(EBT),该工作声称首次在多个维度跑赢标准前馈Transformer扩展曲线。XM建立在作者与合作者(Yilun Du和Heng Ji)的Mode Forcing理论之上,论文坦言大部分结果先被理论预测再被实验验证。
作者承认best-of-K想法不新,前人做过多次;真正贡献是阐明这个简单循环在不拆分生成过程的前提下直接放大生成表达力。局限包括:自回归语言模型仍最难啃,纯端到端Forward XM在极度多mode分布(如图像生成)上太贵。
本文基于机器之心对论文的报道,所有数字和结论均来自该报道,未独立核实原始论文。报道中提及的“逼近业界最好水平”等表述为作者或报道者的判断,非独立验证。
XM用简单的for循环将探索变成生成模型的第三根缩放轴,在图像、视频、语言和机器人控制上显示规模收益,但自回归语言模型仍是挑战,且best-of-K本身并非新想法。
主报道
主报道来源