机器人也有"Aha Moment"!Zetta ζ 闭环物理智能体在线学习
清华AIR与域变换联合推出Zetta ζ,一种闭环物理智能体在线学习系统,通过演进可高频执行的critics,使机器人能在执行过程中实时观察环境、触发恢复,并将经验沉淀为可复用技能。实验显示,Zetta ζ在LIBERO PRO和RoboCasa上分别取得90.8%和93.6%的成功率,远超现有方法,并捕捉到机器人的"Aha Moment",为物理智能体的规模化智能提供了新起点。
清华AIR与域变换联合推出Zetta ζ,一种闭环物理智能体在线学习系统,通过演进可高频执行的critics,使机器人能在执行过程中实时观察环境、触发恢复,并将经验沉淀为可复用技能。实验显示,Zetta ζ在LIBERO PRO和RoboCasa上分别取得90.8%和93.6%的成功率,远超现有方法,并捕捉到机器人的"Aha Moment",为物理智能体的规模化智能提供了新起点。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
清华AIR与域变换联合推出Zetta ζ,通过三环闭环在线学习,让机器人在物理执行中实时纠错、沉淀技能,并在LIBERO-Pro和RoboCasa上实现成功率大幅跃升,甚至出现类似人类的“Aha Moment”。
现有具身智能系统大多“静态、开环”,能执行固定技能,却难以在物理执行中实时感知异常、主动修复。大模型的反思往往发生在episode结束后,无法在线测试备选动作,对完整轨迹做信用分配难度大,回溯分析也难以获取故障瞬间的精确状态。
真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。这导致机器人在面对抓取力度过大、姿态偏移等常见问题时,缺乏在线反馈,无法调整。
Zetta ζ的核心是三个不同时间尺度的闭环。第一环Critic-Governed Action Loop在动作执行频率上持续监控物理状态,一旦发现异常立即触发恢复动作,并通过“VLA Re-entry Contract”确保故障清除后才交还控制权。
第二环Rollout-Batch Candidate Optimization Loop在批量任务后对失败轨迹聚类和因果诊断,定位最早偏离正常状态的时间点,并沿“评估→批评者→状态表征→规划控制→恢复→参数”层级找到根因,自动生成候选更新。
第三环Validation-Gated Skill Update Loop对候选更新先做历史回归测试,再在held-out数据上验证,只有真正提升成功率且能泛化的更新才写入技能记忆库,避免过拟合。
本文信息主要来源于机器之心对清华AIR与域变换联合研究的报道,属于第二手来源。文中实验数据(如成功率、吞吐提升等)均为研究团队声称,未经独立验证,应视为source_claim。部分描述(如“Aha Moment”现象)为研究者观察,需谨慎对待。
主报道
主报道来源