返回信息流
新闻事件
机器之心
1 个来源

让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld

来自香港大学、香港中文大学、浙江大学和快手可灵团队的研究者提出了PlayWorld,一个用于评测世界模型的新基准。它使用Agent Player在交互中观察生成视频的几何一致性、交互保真度和演化合理性,以长程目标为评测单位,而非固定动作序列。该基准已开源评测集和代码。

SynthePulse Insight · AI 深度解读会员精读

PlayWorld:让AI Agent“试玩”世界模型,长程目标评测揭示能力边界

版本 1 · 1 个来源

当评测世界模型不再依赖固定按键序列,而是让AI Agent像真实用户一样“玩”游戏,我们能否更公平地衡量其理解世界的能力?香港大学等机构联合快手可灵团队提出的PlayWorld基准,用171个样本和820余个问题,揭示了当前世界模型在持续演化与空间一致性上的深层短板。

  • PlayWorld由香港大学、香港中文大学、浙江大学和快手可灵团队联合提出,将评测单位从固定动作序列升级为场景相关的长期目标。
  • 核心创新是Agent Player,它通过多模态模型与接口转换器,在交互中动态选择Keep、Stop、Extend、Correct、End五种决策,以适应不同模型的动作粒度。
  • 评测覆盖几何一致性、交互保真度、视野外演化和视野内演化四个维度,共171个样本和820余个问题。
展开章节目录从固定按键到长期目标:评测范式的转变

从固定按键到长期目标:评测范式的转变

传统世界模型评测常采用固定动作序列,例如要求模型执行三次右转,但这种方式无法保证所有模型到达相同视角,导致后续评分失去可比性。PlayWorld的提出者认为,人类试玩时关心的是“是否完成绕场一周并回到原地标”,而非“是否严格执行了三次右转”。因此,PlayWorld将评测单位升级为“场景相关的长期目标”:所有模型面对同一初始世界和同一目标,但允许Agent Player根据实时观察作出必要调整。

这一设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。研究者不要求Agent从零规划整条轨迹,而是基于共享先验进行针对性修正,从而在公平比较与灵活性之间取得平衡。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来源于机器之心对PlayWorld基准的报道,属于二手转述。论文、项目主页、评测集和代码链接均已提供,但具体实验数据(如SANA-WM的通过率)未在报道中给出原始出处,应视为来源声称而非独立确认。

主报道

机器之心

主报道来源