返回信息流
新闻事件
机器之心
1 个来源

UniWorld-View登顶WorldScore榜单,世界模型新突破

兔展智能联合北京大学、鹏城实验室研发的UniWorld-View登顶李飞飞团队WorldScore世界模型榜单。该模型能从单张图片或视频生成新视角,采用遮挡感知点云渲染技术解决大基线新视角合成中的前景背景撕裂和背面漏光问题,并已开源。

SynthePulse Insight · AI 深度解读

UniWorld-View登顶WorldScore:世界模型如何“看见”未被拍摄的世界?

版本 1 · 1 个来源

兔展智能联合北大、鹏城实验室研发的UniWorld-View登顶李飞飞团队WorldScore榜单,提出遮挡感知点云渲染与双流条件注入,解决大基线新视角合成中的前景背景撕裂与背面漏光问题,并完成国产昇腾适配与开源。

  • UniWorld-View登顶李飞飞团队WorldScore世界模型榜单,训练数据来自北大系初创企业元空智能。
  • 提出遮挡感知点云渲染,通过双重投影和法向过滤解决前景背景撕裂与背面漏光。
  • 采用双流条件注入:几何流(点云渲染图+mask)负责结构,外观流(Ref-DiT模块)负责纹理。
  • 同一套模型支持单图3D生成和视频4D生成,实现“统一世界视角”。
  • 完成国产昇腾算力适配,代码与权重已开源。
  • 团队将相关能力产品化,推动视觉AI从模型走向实际应用。
展开章节目录核心挑战:大基线新视角合成

核心挑战:大基线新视角合成

新视角合成的难点在于“大基线”——仅给AI一张正脸,要求推断侧脸甚至后脑勺。过去NeRF、3DGS等重建路线依赖多角度数据,单目视频视角覆盖不足易产生空洞伪影;生成式路线虽能“敢画”,但大多将相机位姿作为抽象条件向量塞入扩散模型,缺乏显式3D建模,大角度下容易失控。

近年研究如ViewCrafter、英伟达GEN3C采用几何模型将画面撑成3D点云,再将目标视角的点云渲染图喂给视频扩散模型,相机控制显著提升。但UniWorld-View团队发现,点云渲染本身存在两个关键问题:前景与背景撕裂(深度边界无连接信息,视角变化时纹理被扯到背景上)和背面漏光(点云无“面”概念,相机绕到背后时正面点直接透过来)。

技术突破:遮挡感知点云渲染与双流条件注入

针对点云渲染的缺陷,UniWorld-View提出遮挡感知点云渲染。第一步是双重投影:将源画面投影到目标视角再原路投影回来,无法“回来”的像素即为遮挡区域,沿相机轨迹逐帧累积成遮挡mask,渲染时挖掉这些区域,避免错误纹理误导生成模型。第二步是法向过滤:为每个点估计法向量,与视线方向计算夹角,背对相机的点直接剔除,解决背面漏光。

几何问题解决后,还需处理纹理细节缺失。UniWorld-View采用双流条件注入:几何流将点云渲染图+mask编码后加到潜变量上,确保生成内容贴合3D结构;外观流通过Ref-DiT模块,以新视角特征为Query、源视频特征为Key/Value做cross-attention,让模型从原视频中“翻素材”补全纹理,连点云伪影造成的模糊纹理也能修复。

统一框架:从单图到视频的4D重建

UniWorld-View采用同一套模型、同一套代码完成单图3D生成和视频4D生成。对于动态视频,它将空间变换与时间推进解耦:先冻结时间在第一帧,绕场生成一圈静态环绕视图作为外观锚点;再在固定机位上生成同步多视角视频,每个机位第一帧用“定妆照”对齐,前景自遮挡通过迭代生成逐步补全。最终生成的多视角视频可用于4DGS优化,实现从单目随手拍到自由视角漫游的完整流程。

开源与产品化

UniWorld-View已登顶李飞飞团队WorldScore榜单,训练数据来自北大系初创企业元空智能,并完成国产昇腾算力适配,代码与权重在GitHub开源。兔展智能团队表示,近期正将相关能力进一步产品化,推动视觉AI从模型走向实际应用。

可信度边界

本文信息主要来自机器之心发布的新闻稿,属于第二手来源。所有技术细节(如双重投影、法向过滤、双流条件注入)均源自该新闻稿,未获独立第三方验证。登顶WorldScore榜单、开源等事实为来源声明,但具体榜单排名细节未提供。

核心结论

UniWorld-View通过遮挡感知点云渲染和双流条件注入,解决了大基线新视角合成的关键难题,并以统一框架支持单图与视频生成,登顶WorldScore榜单并开源,为世界模型研究提供了新路径。

主报道

机器之心

主报道来源