返回信息流
新闻事件
A重点76
机器之心
1 个来源

DreamWorld:用3D几何先验驱动视频扩散,实现更一致的世界生成

智象未来(HiDream.ai)提出 DreamWorld,一种将 3D 基础模型的空间结构先验与视频扩散模型结合的方法,通过显式的几何中间表示提升跨视角一致性与几何稳定性。该工作被 ECCV 2026 录用,并在多个基准上取得领先表现。

SynthePulse Insight · AI 深度解读会员精读

DreamWorld:把几何变成视频生成的“中间站”,能否真正解决3D一致性?

版本 1 · 1 个来源

智象未来(HiDream.ai)提出 DreamWorld,将3D基础模型的结构先验显式引入视频扩散模型,采用“几何先生成、外观后合成”的两阶段框架,在RealEstate10K、Tanks-and-Temples和WorldScore上取得领先结果。但这一设计能否彻底解决大视角变化下的几何不稳定,仍需更多验证。

  • DreamWorld 由智象未来提出,被 ECCV 2026 录用,核心是显式引入3D基础模型的结构先验。
  • 采用 Geometry-then-Appearance 两阶段框架:先生成目标视角的几何表示,再以之为条件生成RGB视频。
  • 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 上取得领先表现,WorldScore 平均分 75.04。
展开章节目录问题:视频生成“看起来真实”不等于3D空间稳定

问题:视频生成“看起来真实”不等于3D空间稳定

随着视频扩散模型能力提升,从单张图像按指定相机轨迹生成新视角视频,成为世界建模的重要路线。但现有方法大多依赖隐式时空表示,缺少显式3D几何接地。在较大视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致。

现有方法通常利用相机参数、Plücker embedding 或单张图像重建的点云投影视图作为条件,虽能实现较好的相机控制,但视频扩散模型仍主要依赖隐式时空表征推断未观测区域。这意味着模型在相机移动时,不仅要生成新内容,还要持续推断原本不可见的三维结构,这正是当前的主要挑战。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来自机器之心对论文的介绍,属于二手报道。论文被 ECCV 2026 录用、具体方法、基准结果等均来自论文本身,但未经独立验证。所有数字和结论应视为论文声称,而非已确认事实。

主报道

机器之心

主报道来源