谷歌DeepMind新推出的GenCeption,借助预训练视频生成模型,一举搞定深度估计、图像分割、3D姿态估计等多个任务,性能直逼甚至超过专用模型,且所需训练数据大幅减少。这对当前Segment Anything、Depth Anything等专用模型主导的局面构成有力挑战,开发者可优先尝试将其作为多任务基础框架,减少重复训练成本。