返回信息流
新闻事件
THE DECODER
1 个来源

谷歌DeepMind称视频生成器已包含计算机视觉缺失的世界模型

谷歌DeepMind的GenCeption系统将视频生成器重新用于深度估计和分割等经典视觉任务,以更少的训练数据达到了最先进的水平。该模型几乎完全在合成视频上训练,其成果加剧了关于视频生成器是否已包含某种通用世界模型的争论。

SynthePulse Insight · AI 深度解读

视频生成器是缺失的世界模型吗?DeepMind 的 GenCeption 给出新证据

版本 1 · 1 个来源

Google DeepMind 提出,视频生成器内部已蕴含计算机视觉长期缺失的“世界模型”。其新模型 GenCeption 将开源视频生成模型改造为通用视觉处理器,在深度估计、分割等任务上以极低数据量达到专业模型水平,但关于“世界模型”的定义争议仍在继续。

  • DeepMind 的 GenCeption 基于阿里巴巴开源视频模型 Wan2.1,通过单次前向传播完成深度估计、表面法线、分割和 3D 姿态估计等多种视觉任务。
  • GenCeption 仅用 7,500 段合成视频训练,数据量仅为同类方法的 1/7 到 1/500,但在多个基准上匹配或超越 DepthAnything 3、SAM 3 等专业模型。
  • 模型从合成人物视频泛化到真实场景、动物和机器人,甚至保留猫须等细节,但联合训练损害了 3D 关键点估计性能。
  • 作者认为视频生成任务迫使模型学习空间与运动表征,支持其作为通用世界模型的论点;但学界对此存在争议,Yann LeCun 等认为像素预测是死胡同。
展开章节目录GenCeption:将视频生成器改造为通用视觉处理器

GenCeption:将视频生成器改造为通用视觉处理器

Google DeepMind 在最新论文中提出 GenCeption,将预训练的视频生成模型重新用于经典计算机视觉任务。该模型基于阿里巴巴的开源 Wan2.1 视频模型,核心改动是简化架构:传统扩散模型需要多步去噪,而 GenCeption 通过单次前向传播直接输出结果,从而满足实际视觉任务的速度要求。

GenCeption 将所有输出统一表示为标准三通道 RGB 图像——无论是深度图、表面法线图还是分割掩码,并通过文本提示指定任务类型。对于 3D 关键点预测等非图像输出,团队添加了可训练模块。所有任务共享一个损失函数,无需为每个任务修改架构。

极低数据量下的 SOTA 性能

GenCeption 的训练数据绝大部分来自合成数据集,仅包含 7,500 段视频。团队将 800 个数字人体模型与 200 段动作捕捉序列结合,在 Blender 中以不同背景和视角渲染。真实视频仅用于语言引导分割任务。

据论文报告,GenCeption 在多个基准上匹配或超越现有专业模型:深度估计与 DepthAnything 3 相当,表面法线估计优于 NormalCrafter 和 Lotus-2,3D 姿态识别超过 Genmo 和 TRAM,复杂语言引导分割则匹配 Meta 的 SAM 3 与 Gemini 3.5 Flash 的组合。其数据量仅为 D4RT、VGGT Omega 等模型的 1/7 到 1/500。

在相同条件下测试,视频生成预训练的效果也优于 V-JEPA 和 VideoMAE V2。作者推断,这一优势来自生成任务本身而非数据规模——视频生成迫使模型学习有用的空间和运动表征。

泛化能力与已知局限

尽管 GenCeption 几乎完全在单人合成视频上训练,但它能泛化到包含多人的真实视频以及动物、人形机器人等未见类别。论文称,部分输出细节甚至超过训练用的 Blender 渲染图,例如能保留猫的胡须和发丝边缘。

然而,联合训练损害了 3D 关键点估计性能。研究者推测,该任务所需的额外组件干扰了基模型在预训练中学到的机制。处理速度也有待提升:小模型处理 81 帧视频约需 6 秒,14B 参数的大模型约需 10 秒。

世界模型之争:视频生成器是答案吗?

DeepMind 作者认为,视频生成器已蕴含一种通用“世界模型”,可成为计算机视觉的基础模型,类似 LLM 在文本领域的角色。他们反驳了将视频生成器仅视为娱乐工具的观点。

但这一论断存在争议。一个国际研究团队近期在 OpenWorldLib 中明确将文本到视频模型排除在外,理由是它们缺乏来自真实世界的反馈。前 Meta 首席 AI 科学家 Yann LeCun 更激进地认为生成式视频模型是死胡同,其团队开发的 V-JEPA 2 采用预测抽象概念而非像素的替代路线。清华大学的一项基准测试也指出像素预测的局限:Sora 2、Seedance 2.0 和 Veo 3.1 在基本物理和逻辑测试中反复失败,尽管输出看起来逼真。

可信度边界

本文主要依据 THE DECODER 对 DeepMind 论文的报道,论文本身为第一手来源。关于世界模型的争议部分引用了报道中提及的第三方观点(OpenWorldLib、LeCun、清华大学基准),这些属于来源中的转述,未独立核实。GenCeption 的性能数据均来自论文声明,尚未经第三方复现。

核心结论

GenCeption 表明,视频生成模型经过简单改造即可在多种视觉任务上以极低数据量达到专业水平,这为“视频生成器蕴含世界模型”的论点提供了有力证据。然而,该论点在学界远未达成共识,模型在 3D 关键点估计上的退化以及处理速度的瓶颈也提示其通用性仍有边界。

主报道

THE DECODER

主报道来源