GenCeption:视频生成模型的真正使命——通用视觉智能

计算机视觉视频生成基础模型 2026年7月10日·Google DeepMind

NLP 已经完成了自己的范式革命。next-token prediction 预训练 + 任务对齐后训练,把成千上万个语言任务压缩进了同一个模型。GPT-4 不再需要单独的翻译模型——它什么都会。

而计算机视觉还在给每个任务造专用模型:SAM 管分割,Depth Anything 管深度,Sapiens 管人体姿态。每个任务一套架构,每个模型一种能力。

GenCeption 想说的是:视频生成不是用来做短视频的——它才是视觉智能的真正催化剂。

核心主张:文本到视频的生成预训练,是视觉领域唯一同时满足"空间-时间-语言"三个维度的预训练范式。视频扩散模型在学习生成画面的过程中被迫内化的世界先验,可以直接迁移为通用的视觉感知能力。
figure
图1:GenCeption 方法论全景。视频扩散模型作为预训练基座,捕获时空世界先验和视觉-语言对齐;经多任务后训练适配为前馈感知模型,推动从专用模型到通用模型的范式转移。

问题的本质:视觉领域缺一个"next-token prediction"

要理解这篇论文的历史定位,先回顾 NLP 发生了什么。

2018 年之前,NLP 和今天的 CV 一模一样——每个任务一个专用模型。然后 GPT 出现了:一个统一的目标函数(预测下一个 token),在足够大的数据上训练,配上后训练,涌现出通用语言智能。

视觉领域一直没找到这个统一目标函数。CLIP 路线的对比学习有视觉-语言对齐,但缺时空维度——它知道"这是一只猫",但不理解"这只猫在跳跃"。MAE/JEPA 路线的掩码预测可扩展性好,但缺语言对齐——学到了视觉表征,却无法跟语言世界沟通。

作者提出三条判据,任何视觉预训练范式要成为通用智能的催化剂,必须同时满足:

  1. 时空演化:世界是 4D 连续体,预训练目标必须迫使模型内化物理因果和运动规律。
  2. 视觉-语言对齐:视觉特征要原生与语言语义对齐,才能继承 LLM 的指令跟随和常识能力。
  3. 可规模化:数据和算力都能无上限堆叠。

文本到视频生成天然满足全部三条:生成高保真视频逼着模型学 3D 几何、物体恒常性、物理交互;文本条件提供原生对齐;视频数据标注成本低、商业价值高,已经被工业界推到了海量规模。

figure
图2:GenCeption 架构。输入视频和文本指令,模型在单次前向传播中动态推断目标模态,输出对应感知结果——深度、法向、分割、位姿,全部同一架构。

方法:从扩散生成到前馈感知

扩散 → 前馈,一步到位

视频扩散模型本质是迭代去噪:从纯噪声一步步"画"出清晰画面。GenCeption 直接砍掉迭代过程,把预训练扩散 backbone 改造成单步前馈感知模型。

为什么能这么做?因为预训练阶段模型已经学到了足够丰富的视觉先验——对 3D 结构、运动模式、物体外观的深刻理解。后训练不是从零学感知,而是"激活"这些已经存在的先验。推理成本也因此可控:单次前向传播,不需要几十步去噪。

统一任务表示:把任务下推到数据层

不同视觉任务的输出差异巨大——深度图、像素标签、空间坐标。传统做法是为每个任务定制 head 和 loss。GenCeption 反其道而行:把任务特异性从架构层下推到数据格式层。

所有任务的输出被映射到统一的 RGB 图像格式——深度用颜色编码,法向量用颜色空间表示,相机位姿用"Rothko 光线图"映射到三通道。模型不需要知道它在做什么任务,只需根据文本指令输出对应的"图像"。

figure
图3:"Rothko"光线图——将相机位姿等高维模态压缩到标准 3 通道 RGB。扩散模型的标准输出格式因此可以承载任意感知模态。

统一架构、统一 head、统一 loss。这跟 next-token prediction 是同一种哲学:不要把理解嵌入架构设计,把理解交给数据和规模。新任务不再需要改模型,只需要设计新的数据格式。

合成数据驱动

后训练主要用 3D 仿真引擎批量生成的合成数据——自带像素级完美标注(深度、法向、位姿、3D 关键点),要多少有多少,零人工成本。这是 GenCeption 数据效率惊人的关键原因。

实验:通用模型正面击败专用模型

figure
图4:左——GenCeption 在全部任务上匹配或超越专用 SOTA 模型;右——同等条件下视频生成预训练优于 V-JEPA 和 VideoMAE V2,且随数据和模型规模持续提升。

GenCeption 在五大任务上全面对标各领域最强专用模型:

任务对标的专用 SOTA结果
深度估计DepthAnything V3匹配或超越
表面法向量Lotus-2, Genmo匹配或超越
相机位姿VGGT-Ω, D4RT匹配(数据少 7-500 倍)
指代表达分割SAM3匹配或超越
3D 关键点Sapiens, David匹配或超越

最扎眼的数字是数据效率:GenCeption 用 D4RT 和 VGGT-Ω 的 1/7 到 1/500 的训练数据,实现了可比性能。预训练学到的先验如此通用,后训练只需极少样本就能激活。

figure
图5:深度和表面法向量估计效果。输入普通 RGB 视频,单次前向传播输出高精度几何信息。
figure
图6:指代表达分割定性结果。"穿红衣服的人""左边的杯子""正在移动的狗"——物体、颜色、空间关系、运动状态的自然语言描述都能精确定位。

与替代预训练范式的对照实验同样干脆:同等模型规模、同样微调数据下,视频生成预训练 backbone 打败了 V-JEPA 和 VideoMAE V2 的最大可用版本。层数迁移实验进一步证实:从预训练模型迁移的层数越多,性能越好——生成预训练学到的表征逐层都有价值。

figure
图7:预训练权重迁移层数 vs 性能。迁移层数越多精度越高,证明生成先验确实全面转化为了感知能力。

涌现:合成数据训练,泛化到真实世界

figure
图8:涌现的泛化行为。模型只在合成人体视频上训练,却能 zero-shot 泛化到真实世界视频和从未见过的类别——动物、机器人。

GenCeption 最令人瞠目的结果不是 SOTA 数字,而是这个:模型只训练在合成人体视频上,却直接泛化到了真实世界视频,以及训练时从未见过的物体类别——动物、机器人。

不是 fine-tune,是 zero-shot。

这意味着视频生成预训练学到的不只是像素分布,而是更深层的世界结构——什么是物理运动、什么是 3D 结构、物体之间的空间关系如何。这些理解超越了训练数据的表面分布。

如果说语言智能的 next-token prediction 是让模型预测下一个词时被迫理解整个世界,那么视觉智能的 next-frame prediction 就是让模型预测下一帧时被迫理解 4D 物理世界。

对 CV 领域意味着什么

这不是增量改进——它在命题层面给出了视觉基础模型的第三条道路。前两条:CLIP 路线的对比学习、MAE/JEPA 路线的掩码预测。GenCeption 的第三条:视频生成预训练,同时覆盖空间、时间、语言三个维度,且已被工业界推到足够大的规模。

如果走通,未来不再需要为每个视觉任务养一个专用模型——一个模型解决深度、分割、位姿、关键点、法向量,就像 GPT-4 消灭了专用 NLP 模型一样。

对做视频理解和检索的工程团队,这篇论文还有一层直接启示:手里的视频生成模型可能比想象的值钱得多——它的内部表征本身就是感知金矿,提取和复用这些表征可能比从头训练感知模型划算几个数量级。

局限与开放问题

但这些局限恰恰说明这项工作是一个方向的起点而不是终点。视频生成模型的规模还在快速膨胀——GenCeption 证明的是:这条路值得走。

视频生成最赚钱的应用也许是做短视频,但它最重要的遗产,可能是一个通用视觉智能系统。