国产世界模型登顶李飞飞团队榜单!适配昇腾算力、代码权重全开源
由兔展智能联合北大、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队世界模型榜单WorldScore。该模型支持单图或视频生成新视角,实现精确相机位姿控制,已适配国产昇腾算力,代码和权重已全部开源。
由兔展智能联合北大、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队世界模型榜单WorldScore。该模型支持单图或视频生成新视角,实现精确相机位姿控制,已适配国产昇腾算力,代码和权重已全部开源。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
兔展智能联合北大、鹏城实验室研发的UniWorld-View登顶李飞飞团队WorldScore榜单,通过遮挡感知点云渲染和双流条件注入,解决了大基线新视角合成中的前景背景撕裂和背面漏光问题,代码权重已全部开源。
新视角合成(Novel View Synthesis)本质是让AI“脑补”未拍摄的角度,难点在于“大基线”(large-baseline)——即只给AI看正脸,让它画出侧脸甚至后脑勺。传统NeRF、3DGS方法依赖多视角重建,单目视频视角覆盖不足时易产生空洞伪影;生成式方法虽能“画”,但相机位姿仅作为抽象条件向量输入,缺乏显式3D建模,大角度旋转时容易失控。
近两年出现的第三条路线:先用几何模型将画面转为3D点云,再将目标视角的点云渲染图作为条件输入视频扩散模型,如ViewCrafter、英伟达GEN3C。但UniWorld-View团队发现,点云渲染步骤存在两个未解决的“坑”:前景背景撕裂和背面漏光。
点云由孤立点组成,缺乏连接和面信息。视角大角度变化时,前景背景撕裂表现为深度边界处纹理被拉扯;背面漏光则因点云不自动遮挡,正面点透到背面。UniWorld-View的第一板斧是“遮挡感知点云渲染”,包含两招:
第一招:双重投影。将源画面投影到目标视角再原路投影回来,无法“回来”的像素即为遮挡区域,逐帧累积成遮挡mask并挖掉,避免错误纹理误导生成模型。第二招:法向过滤。为每个点估计法向量,与视线方向计算夹角,背对相机的点直接剔除。两招结合,条件图中的错误信号被清零,仅保留可靠几何和明确的待补区域。
点云渲染图“位置对但内容缺”,源视频“内容全但位置不对”。UniWorld-View采用“双流条件注入”架构:几何流将点云渲染图+mask编码后加到潜变量上,确保生成内容贴合3D结构;外观流通过新设计的Ref-DiT模块,以新视角特征为Query、源视频特征为Key/Value做cross-attention,让模型从源视频中“翻素材”补全纹理,甚至修复点云伪影造成的模糊。
几何流管构图,外观流管上色,分工明确。
UniWorld-View进一步将单目视频转为多视角视频,实现4D重建(动态3DGS)。常规方法相机“边走边拍”,空间变换与时间推进耦合,视角分布不均。UniWorld-View解耦两者:先冻结时间,在第一帧生成一圈静态环绕视图作为外观锚点;再在固定机位上生成同步多视角视频,每个机位第一帧用“定妆照”对齐,前景自遮挡通过迭代生成补全。生成多视角视频后,喂给4DGS优化,得到最终4D场景。
兔展智能由北京大学校友与北京大学视觉领域青年领军人才联合创立,专注视觉AI大模型研发,拥有基于视觉大模型的多模态大模型底层自研技术。公司自主研发Open-Sora Plan、UniWorld等系列模型,其中Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量全球第一。
UniWorld-View已适配国产昇腾算力,代码和权重全部开源,训练数据来自北大系初创企业元空智能。
本文信息主要来源于量子位报道,其中技术细节和模型性能来自兔展智能团队的公开描述,未经第三方独立验证。榜单排名基于李飞飞团队WorldScore榜单,但具体评分标准和对比方法未在来源中详述。
UniWorld-View通过遮挡感知点云渲染和双流条件注入,有效解决了大基线新视角合成中的关键难题,登顶权威榜单并开源,为4D场景生成提供了新路径。
主报道
主报道来源