返回信息流
新闻事件
A重点78
机器之心
1 个来源

机器人也有"Aha Moment"!Zetta ζ 闭环物理智能体在线学习

清华AIR与域变换联合推出Zetta ζ,一种闭环物理智能体在线学习系统,通过演进可高频执行的critics,使机器人能在执行过程中实时观察环境、触发恢复,并将经验沉淀为可复用技能。实验显示,Zetta ζ在LIBERO PRO和RoboCasa上分别取得90.8%和93.6%的成功率,远超现有方法,并捕捉到机器人的"Aha Moment",为物理智能体的规模化智能提供了新起点。

SynthePulse Insight · AI 深度解读会员精读

Zetta ζ:让机器人在执行中“顿悟”,闭环自进化开启具身智能新路径

版本 1 · 1 个来源

清华AIR与域变换联合推出Zetta ζ,通过三环闭环在线学习,让机器人在物理执行中实时纠错、沉淀技能,并在LIBERO-Pro和RoboCasa上实现成功率大幅跃升,甚至出现类似人类的“Aha Moment”。

  • Zetta ζ 是清华AIR与域变换联合推出的闭环在线学习自进化物理智能体,旨在解决现有具身智能系统“静态、开环”的问题。
  • 其核心是三个不同时间尺度的闭环:动作级Critic监控、批量候选优化、验证门控更新,构成“自进化飞轮”。
  • 在LIBERO-Pro上,Zetta ζ将平均成功率从34.5%提升至90.8%;在RoboCasa上从73.56%提升至93.56%。
展开章节目录背景:物理世界中的在线学习困境

背景:物理世界中的在线学习困境

现有具身智能系统大多“静态、开环”,能执行固定技能,却难以在物理执行中实时感知异常、主动修复。大模型的反思往往发生在episode结束后,无法在线测试备选动作,对完整轨迹做信用分配难度大,回溯分析也难以获取故障瞬间的精确状态。

真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。这导致机器人在面对抓取力度过大、姿态偏移等常见问题时,缺乏在线反馈,无法调整。

Zetta ζ的三环自进化机制

Zetta ζ的核心是三个不同时间尺度的闭环。第一环Critic-Governed Action Loop在动作执行频率上持续监控物理状态,一旦发现异常立即触发恢复动作,并通过“VLA Re-entry Contract”确保故障清除后才交还控制权。

第二环Rollout-Batch Candidate Optimization Loop在批量任务后对失败轨迹聚类和因果诊断,定位最早偏离正常状态的时间点,并沿“评估→批评者→状态表征→规划控制→恢复→参数”层级找到根因,自动生成候选更新。

第三环Validation-Gated Skill Update Loop对候选更新先做历史回归测试,再在held-out数据上验证,只有真正提升成功率且能泛化的更新才写入技能记忆库,避免过拟合。

限时免费

继续阅读完整分析

还有 3 节深入分析和完整结论

加载中

可信度边界

本文信息主要来源于机器之心对清华AIR与域变换联合研究的报道,属于第二手来源。文中实验数据(如成功率、吞吐提升等)均为研究团队声称,未经独立验证,应视为source_claim。部分描述(如“Aha Moment”现象)为研究者观察,需谨慎对待。

主报道

机器之心

主报道来源