返回新闻列表
2026-07-21 09:09

Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破

文本核心速览
  1. 多任务视觉模型Google DeepMind发布GenCeption,基于预训练视频生成模型Wan2.1,可同时处理深度估计、图像分割、3D姿态估计等多任务,一次前向传播即输出多种结果。
  2. 数据效率显著仅使用7500个合成视频训练,数据量仅为部分现有模型的七分之一至五百分之一,在多项基准测试中性能接近或超过Depth Anything等专用模型。
  3. 泛化能力突出虽训练数据来自单人合成人体视频,但能处理真实多人场景、动物及人形机器人等未见类别,生成细节丰富的预测结果。
  4. 成本与局限性联合训练可能影响复杂任务性能,推理速度需优化,处理81帧视频约需6至10秒。视频生成模型正向视觉理解基础模型拓展。

GenCeption用7500个合成视频接近SOTA,训练数据仅为专用模型的五百分之一

新模型干了什么

DeepMind扔出的 GenCeption 模型,基于预训练视频生成模型构建,在深度估计、图像分割、3D姿态估计等经典计算机视觉任务上拿到了接近或超过当前领先水平的分数。训练数据规模只有传统专用视觉模型的几分之一——比如大家熟悉的 Segment AnythingDepth Anything 这类任务专用模型,每个任务通常要单独搭架构。

技术圈里有人在传,大型文本到视频模型在训练过程中学会了场景空间结构、物体运动规律以及语言与视觉之间的关联,可能具备成为通用视觉基础模型的潜力。GenCeption 基于阿里巴巴开源视频模型 Wan2.1 开发,通过简化架构实现一次前向传播就能完成视觉任务预测。

模型可以根据文本提示,从同一段视频中同时生成深度图、表面法线、分割掩码以及姿态估计结果,还能通过可训练模块输出3D关键点等非图像结果。

数据有多省

训练数据方面,GenCeption 主要使用了一个包含 7500个视频 的合成数据集——这些视频由 800个人体模型 结合 200组动作序列,并通过 Blender 渲染生成。数量不多,大概也就是个小型B站UP主一周的产出。

论文中的实验结果显示,该模型在深度估计、表面法线预测、3D姿态识别以及语言引导分割等任务中均表现优异,而它的训练数据量仅为部分现有模型的 七分之一至五百分之一。换句话说,别人用100个视频训练,它可能只用1个就追上了。

泛化有多强

尽管训练数据主要来自单人合成人体视频,但 GenCeption 能处理真实世界中的 多人场景动物 以及 人形机器人 等未见类别,并且生成包含细节的视觉预测结果。有博主在推特上试了说:泛化能力确实超出预期,特别是在零样本场景下。

短板在哪

不过有研究者承认,联合训练多个任务可能会影响部分复杂任务的性能,同时模型推理速度仍需优化——目前大模型处理 81帧视频 大约需要 6至10秒。这个速度比实时慢不少,相当于你要等几秒才能看到结果,在自动驾驶等场景里显然不够用。

这意味着什么

GenCeption 的发布表明,视频生成模型正在从内容生成工具向视觉理解基础模型方向拓展。接下来要盯着看它能否在物理理解和现实反馈上突破,同时把推理速度压到每秒30帧以上——这会让现有的专用视觉模型团队(比如 Segment Anything 那帮人)感受到压力,也会让机器人厂商开始认真考虑用它替代传统视觉 pipeline。

来源: aibase阅读原文

其他新闻

查看全部