机器之心
1 个来源让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld
来自香港大学、香港中文大学、浙江大学和快手可灵团队的研究者提出了PlayWorld,一个用于评测世界模型的新基准。它使用Agent Player在交互中观察生成视频的几何一致性、交互保真度和演化合理性,以长程目标为评测单位,而非固定动作序列。该基准已开源评测集和代码。
来自香港大学、香港中文大学、浙江大学和快手可灵团队的研究者提出了PlayWorld,一个用于评测世界模型的新基准。它使用Agent Player在交互中观察生成视频的几何一致性、交互保真度和演化合理性,以长程目标为评测单位,而非固定动作序列。该基准已开源评测集和代码。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
当评测世界模型不再依赖固定按键序列,而是让AI Agent像真实用户一样“玩”游戏,我们能否更公平地衡量其理解世界的能力?香港大学等机构联合快手可灵团队提出的PlayWorld基准,用171个样本和820余个问题,揭示了当前世界模型在持续演化与空间一致性上的深层短板。
传统世界模型评测常采用固定动作序列,例如要求模型执行三次右转,但这种方式无法保证所有模型到达相同视角,导致后续评分失去可比性。PlayWorld的提出者认为,人类试玩时关心的是“是否完成绕场一周并回到原地标”,而非“是否严格执行了三次右转”。因此,PlayWorld将评测单位升级为“场景相关的长期目标”:所有模型面对同一初始世界和同一目标,但允许Agent Player根据实时观察作出必要调整。
这一设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。研究者不要求Agent从零规划整条轨迹,而是基于共享先验进行针对性修正,从而在公平比较与灵活性之间取得平衡。
本文信息主要来源于机器之心对PlayWorld基准的报道,属于二手转述。论文、项目主页、评测集和代码链接均已提供,但具体实验数据(如SANA-WM的通过率)未在报道中给出原始出处,应视为来源声称而非独立确认。
主报道
主报道来源