让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍
北京大学等机构的研究团队提出Jetson-PI方案,通过异步推理、模型调度和底层推理引擎优化,在NVIDIA Jetson Orin上将VLA模型的控制频率从0.70 Hz提升至6.06 Hz,提升8.66倍,且不损失模型准确率。该方案解决了端侧设备上VLA模型推理延迟高、感知执行错位等问题,使具身智能从实验室演示迈向工业级应用。
北京大学等机构的研究团队提出Jetson-PI方案,通过异步推理、模型调度和底层推理引擎优化,在NVIDIA Jetson Orin上将VLA模型的控制频率从0.70 Hz提升至6.06 Hz,提升8.66倍,且不损失模型准确率。该方案解决了端侧设备上VLA模型推理延迟高、感知执行错位等问题,使具身智能从实验室演示迈向工业级应用。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当VLA模型部署到机载设备时,推理延迟导致控制频率仅0.7Hz。北大等团队提出Jetson-PI,通过前瞻对齐异步推理、置信度调度和底层引擎优化,在Jetson Orin上实现6.06Hz控制频率,提升8.66倍,且不损失准确率。
将VLA模型部署到机载设备面临双重挑战。一方面,依赖外接高端GPU会显著增加功耗、缩短续航,限制机器人活动范围;另一方面,直接在Jetson Orin等端侧设备上运行,π0.5一次推理约需1.4秒,控制频率仅0.7Hz,导致机器人动作迟缓且出现明显停顿。
朴素异步推理虽能隐藏部分延迟,但引入两个新问题:感知与执行错位(模型推理时环境已变化)和反应时间过长(仍受完整推理延迟限制)。以往方法尝试融合新旧轨迹,但在复杂任务中仍可能因动作误差导致失败。
Jetson-PI提出Foresight-Aligned Asynchronous Correction,训练一个约40M参数的轻量级未来修正模块。该模块根据当前VLM环境表征和已提交动作,预测未来时刻的环境表征,使动作专家从未来时间点开始生成动作,而非基于过时观测。模块仅预测VLM最后一层表征,避免生成完整图像的高成本。
基于置信度的调度机制让系统判断何时跳过VLM:未来修正模块同时输出置信度,高于阈值时直接调用动作专家(推理更快),低于阈值时重新调用VLM刷新环境。实际测试中,抓取、放置等关键步骤置信度下降,触发VLM更新,而平稳动作时保持高置信度。
研究团队基于llama.cpp开发Jetson-PI-Edge,针对VLA特性进行三项优化:计算图复用(固定输入尺寸下首次构建CUDA Graph后复用)、常驻GPU中间缓存(避免ViT、LLM和动作专家间数据往返CPU)、flow matching展开(将多轮去噪合并到统一计算图)。
优化后,π0.5在Jetson Orin上单次推理时间降至412.9ms,动作专家推理从536.8ms降至123.1ms。结合置信度调度,系统反应时间进一步降至165.1ms,控制频率达6.06Hz,较原生PyTorch提升8.66倍,且未使用量化或剪枝。
在LIBERO四个子数据集上,Jetson-PI平均成功率比VLASH高14.8个百分点,比RTC高3.9个百分点。延迟越大优势越明显:当延迟步数Δ=9时,Jetson-PI平均成功率比VLASH高45.6个百分点,比RTC高7.0个百分点,表明未来环境预测在长延迟下至关重要。
在PrimeBot X2-W机器人上执行衣物折叠任务时,Jetson-PI实现了更连续流畅的动作,避免了同步推理的停顿和朴素异步推理的错位。机器人配备一个头部摄像头和两个腕部摄像头,以15Hz频率执行动作。
本文基于机器之心对北大等团队论文的报道,论文已发表于arXiv(2607.12659),代码已开源。所有性能数据均来自论文实验,未引入外部验证。
Jetson-PI通过算法-系统协同设计,在不牺牲准确率的前提下,将端侧VLA控制频率提升至6Hz,为移动机器人长期自主运行提供了可行路径。
主报道
主报道来源