A重点76
机器之心
1 个来源DreamWorld:用3D几何先验驱动视频扩散,实现更一致的世界生成
智象未来(HiDream.ai)提出 DreamWorld,一种将 3D 基础模型的空间结构先验与视频扩散模型结合的方法,通过显式的几何中间表示提升跨视角一致性与几何稳定性。该工作被 ECCV 2026 录用,并在多个基准上取得领先表现。
智象未来(HiDream.ai)提出 DreamWorld,一种将 3D 基础模型的空间结构先验与视频扩散模型结合的方法,通过显式的几何中间表示提升跨视角一致性与几何稳定性。该工作被 ECCV 2026 录用,并在多个基准上取得领先表现。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
智象未来(HiDream.ai)提出 DreamWorld,将3D基础模型的结构先验显式引入视频扩散模型,采用“几何先生成、外观后合成”的两阶段框架,在RealEstate10K、Tanks-and-Temples和WorldScore上取得领先结果。但这一设计能否彻底解决大视角变化下的几何不稳定,仍需更多验证。
随着视频扩散模型能力提升,从单张图像按指定相机轨迹生成新视角视频,成为世界建模的重要路线。但现有方法大多依赖隐式时空表示,缺少显式3D几何接地。在较大视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致。
现有方法通常利用相机参数、Plücker embedding 或单张图像重建的点云投影视图作为条件,虽能实现较好的相机控制,但视频扩散模型仍主要依赖隐式时空表征推断未观测区域。这意味着模型在相机移动时,不仅要生成新内容,还要持续推断原本不可见的三维结构,这正是当前的主要挑战。
本文信息主要来自机器之心对论文的介绍,属于二手报道。论文被 ECCV 2026 录用、具体方法、基准结果等均来自论文本身,但未经独立验证。所有数字和结论应视为论文声称,而非已确认事实。
主报道
主报道来源