GenCeption:视频生成模型的真正使命——通用视觉智能
NLP 已经完成了自己的范式革命。next-token prediction 预训练 + 任务对齐后训练,把成千上万个语言任务压缩进了同一个模型。GPT-4 不再需要单独的翻译模型——它什么都会。
而计算机视觉还在给每个任务造专用模型:SAM 管分割,Depth Anything 管深度,Sapiens 管人体姿态。每个任务一套架构,每个模型一种能力。
GenCeption 想说的是:视频生成不是用来做短视频的——它才是视觉智能的真正催化剂。
问题的本质:视觉领域缺一个"next-token prediction"
要理解这篇论文的历史定位,先回顾 NLP 发生了什么。
2018 年之前,NLP 和今天的 CV 一模一样——每个任务一个专用模型。然后 GPT 出现了:一个统一的目标函数(预测下一个 token),在足够大的数据上训练,配上后训练,涌现出通用语言智能。
视觉领域一直没找到这个统一目标函数。CLIP 路线的对比学习有视觉-语言对齐,但缺时空维度——它知道"这是一只猫",但不理解"这只猫在跳跃"。MAE/JEPA 路线的掩码预测可扩展性好,但缺语言对齐——学到了视觉表征,却无法跟语言世界沟通。
作者提出三条判据,任何视觉预训练范式要成为通用智能的催化剂,必须同时满足:
- 时空演化:世界是 4D 连续体,预训练目标必须迫使模型内化物理因果和运动规律。
- 视觉-语言对齐:视觉特征要原生与语言语义对齐,才能继承 LLM 的指令跟随和常识能力。
- 可规模化:数据和算力都能无上限堆叠。
文本到视频生成天然满足全部三条:生成高保真视频逼着模型学 3D 几何、物体恒常性、物理交互;文本条件提供原生对齐;视频数据标注成本低、商业价值高,已经被工业界推到了海量规模。
方法:从扩散生成到前馈感知
扩散 → 前馈,一步到位
视频扩散模型本质是迭代去噪:从纯噪声一步步"画"出清晰画面。GenCeption 直接砍掉迭代过程,把预训练扩散 backbone 改造成单步前馈感知模型。
为什么能这么做?因为预训练阶段模型已经学到了足够丰富的视觉先验——对 3D 结构、运动模式、物体外观的深刻理解。后训练不是从零学感知,而是"激活"这些已经存在的先验。推理成本也因此可控:单次前向传播,不需要几十步去噪。
统一任务表示:把任务下推到数据层
不同视觉任务的输出差异巨大——深度图、像素标签、空间坐标。传统做法是为每个任务定制 head 和 loss。GenCeption 反其道而行:把任务特异性从架构层下推到数据格式层。
所有任务的输出被映射到统一的 RGB 图像格式——深度用颜色编码,法向量用颜色空间表示,相机位姿用"Rothko 光线图"映射到三通道。模型不需要知道它在做什么任务,只需根据文本指令输出对应的"图像"。
统一架构、统一 head、统一 loss。这跟 next-token prediction 是同一种哲学:不要把理解嵌入架构设计,把理解交给数据和规模。新任务不再需要改模型,只需要设计新的数据格式。
合成数据驱动
后训练主要用 3D 仿真引擎批量生成的合成数据——自带像素级完美标注(深度、法向、位姿、3D 关键点),要多少有多少,零人工成本。这是 GenCeption 数据效率惊人的关键原因。
实验:通用模型正面击败专用模型
GenCeption 在五大任务上全面对标各领域最强专用模型:
| 任务 | 对标的专用 SOTA | 结果 |
|---|---|---|
| 深度估计 | DepthAnything V3 | 匹配或超越 |
| 表面法向量 | Lotus-2, Genmo | 匹配或超越 |
| 相机位姿 | VGGT-Ω, D4RT | 匹配(数据少 7-500 倍) |
| 指代表达分割 | SAM3 | 匹配或超越 |
| 3D 关键点 | Sapiens, David | 匹配或超越 |
最扎眼的数字是数据效率:GenCeption 用 D4RT 和 VGGT-Ω 的 1/7 到 1/500 的训练数据,实现了可比性能。预训练学到的先验如此通用,后训练只需极少样本就能激活。
与替代预训练范式的对照实验同样干脆:同等模型规模、同样微调数据下,视频生成预训练 backbone 打败了 V-JEPA 和 VideoMAE V2 的最大可用版本。层数迁移实验进一步证实:从预训练模型迁移的层数越多,性能越好——生成预训练学到的表征逐层都有价值。
涌现:合成数据训练,泛化到真实世界
GenCeption 最令人瞠目的结果不是 SOTA 数字,而是这个:模型只训练在合成人体视频上,却直接泛化到了真实世界视频,以及训练时从未见过的物体类别——动物、机器人。
不是 fine-tune,是 zero-shot。
这意味着视频生成预训练学到的不只是像素分布,而是更深层的世界结构——什么是物理运动、什么是 3D 结构、物体之间的空间关系如何。这些理解超越了训练数据的表面分布。
如果说语言智能的 next-token prediction 是让模型预测下一个词时被迫理解整个世界,那么视觉智能的 next-frame prediction 就是让模型预测下一帧时被迫理解 4D 物理世界。
对 CV 领域意味着什么
这不是增量改进——它在命题层面给出了视觉基础模型的第三条道路。前两条:CLIP 路线的对比学习、MAE/JEPA 路线的掩码预测。GenCeption 的第三条:视频生成预训练,同时覆盖空间、时间、语言三个维度,且已被工业界推到足够大的规模。
如果走通,未来不再需要为每个视觉任务养一个专用模型——一个模型解决深度、分割、位姿、关键点、法向量,就像 GPT-4 消灭了专用 NLP 模型一样。
对做视频理解和检索的工程团队,这篇论文还有一层直接启示:手里的视频生成模型可能比想象的值钱得多——它的内部表征本身就是感知金矿,提取和复用这些表征可能比从头训练感知模型划算几个数量级。
局限与开放问题
- 任务覆盖有限:目前只有几何、分割、姿态等感知任务;场景图、视觉问答、关系推理尚未纳入。
- 感知 ≠ 推理:GenCeption 告诉你"看到了什么",但还不能像 LLM 一样对所见做推理。这是下一步。
- 分辨率受限:受当前视频生成架构约束,处理不了高分辨率长视频。
- 推理速度:比迭代扩散快,但仍不如轻量专用模型。
但这些局限恰恰说明这项工作是一个方向的起点而不是终点。视频生成模型的规模还在快速膨胀——GenCeption 证明的是:这条路值得走。
视频生成最赚钱的应用也许是做短视频,但它最重要的遗产,可能是一个通用视觉智能系统。