反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
上海交大与无界动力具身智能实验室联合团队提出了一种名为Grounded Semantic Re-Binding (GSR) 的简单方法,用于提升视觉-语言-动作模型(VLA)在指令改写下的泛化能力。该方法通过重新设计语言语义进入视觉与动作计算路径的方式,使模型在LIBERO-Para等基准测试上性能提升20-40%,且无需大量paraphrase训练。该研究揭示了VLA模型在指令泛化上的关键问题,并提供了有效解决方案。
上海交大与无界动力具身智能实验室联合团队提出了一种名为Grounded Semantic Re-Binding (GSR) 的简单方法,用于提升视觉-语言-动作模型(VLA)在指令改写下的泛化能力。该方法通过重新设计语言语义进入视觉与动作计算路径的方式,使模型在LIBERO-Para等基准测试上性能提升20-40%,且无需大量paraphrase训练。该研究揭示了VLA模型在指令泛化上的关键问题,并提供了有效解决方案。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
上海交大与无界动力团队提出GSR方法,通过重新设计语言语义的注入路径,在不依赖大量改写数据的情况下,将VLA模型在LIBERO-Para上的指令泛化成功率提升最高44.65个百分点,并揭示了语言泛化失败背后的机制。
在具身智能领域,VLA模型常因指令泛化能力不足而受到诟病。标准benchmark如LIBERO中,训练和测试指令高度相似,掩盖了模型是否真正理解任务含义的问题。当指令被简单改写,如将“抓取较大的红色物体”改为“拿起尺寸更大的红色方块”,模型性能可能大幅下降。
论文在LIBERO-Para上评估了三个模型:SmolVLA在原始指令上成功率为72.0%,改写后仅剩4.47%;VLA-Adapter从98.2%降至46.82%;即使经过大规模异构数据训练的π0.5也存在性能损失。这表明高成功率并不等于稳定的指令跟随能力。
论文通过动作级检索实验发现,改写指令生成的动作仍比随机更接近正确任务,说明任务信息并未消失。逐层特征干预进一步显示,在VLA-Adapter中,将改写指令的语言特征替换为原始指令特征,可恢复96.8%的动作差异,闭环成功率从60%提升至96%。
然而,不同架构的语义控制位置不同:SmolVLA和π0.5中单层替换最多恢复约10.5%和31.3%,表明其任务信息分散在多层。此外,控制实验显示,动态图像和措辞变化都会扰动语言表示,移除措辞方向后闭环成功率从55%提升至90%。
GSR方法分三步:首先用冻结的T5编码器单独处理语言指令,不接收图像和状态,提取稳定语义;然后根据不同VLA的融合位置,将投影后的T5语义重新注入;最后重新初始化并训练Action Expert,使其学习新的语言条件。
在LIBERO-Para上,GSR将VLA-Adapter的成功率从46.82%提升至70.94%,SmolVLA从4.47%提升至49.12%,π0.5从73.60%提升至75.59%,并取得最高PRIDE分数70.4。所有模型仅使用原始指令训练,未使用改写数据。
语言路径权威实验显示,仅添加T5而不重构信息流无效:VLA-Adapter的Native+T5仅从46.82%提升至47.31%,SmolVLA对应版本为13.49%。当原生路径接收错误指令时,成功率降至5.11%,而T5接收错误指令时仍为44.0%,说明原生路径仍主导控制。
实验性架构ParaVLA使用冻结T5和DINOv2,在原始和改写指令上分别取得92%和91%的成功率,仅差1个百分点。但完全解耦也带来扩展性问题,未来需平衡稳定语义、场景grounding和模型扩展能力。
本文基于机器之心对论文的报道,所有数据均来自论文实验,但未经独立验证。部分性能提升幅度(如20-40%)为论文声称,需以原始论文为准。
VLA指令泛化失败并非因为模型完全误解指令,而是等价表达间的特征偏移被下游放大。GSR通过提供稳定语义源并重构信息流,有效提升泛化能力,但需针对不同架构定制注入位置。
主报道
主报道来源