AI视觉模型,正在从专用模型原生统一,转变成视觉通用智能。
商汤刚刚开源的理解生成统一视觉大模型SenseNova-Vision,正是这个方向的尝试。
无独有偶,由AI视觉领域的杰出科学家何恺明参与,谷歌DeepMind、多伦多大学 、伦敦大学学院 、牛津大学、麻省理工学院等团队发布的,由文本指令控制的通用视觉理解系统GenCeption,正在将计算机视觉从“特定任务专用”的模型,转变为“通用视觉智能”,就像自然语言处理从“特定任务专用”的模型演变为“通用语言智能”一样。


GenCeption 将一个预先训练好的视频生成模型重新加以利用,打造出一个统一、通用的前馈式视觉模型。
该模型能够以最先进的性能解决各种视觉任务。模型的学习效率极高,同时还能产生许多有趣的现象。
视频生成或许远不止是视觉系统的一项下游能力,它本身就可以成为视觉领域的通用预训练任务。
GenCeption把一个140亿参数的文生视频扩散模型,改造成单步前馈的通用视觉模型,可完成深度估计、表面法线预测、前景分割、指代表达分割、相机位姿估计和2D/3D关键点预测等多种任务。

在多个基准上接近或超过Depth Anything V3、SAM 3、D4RT、VGGT-Ω、Sapiens、Genmo等专用模型,还展现出训练范围之外的泛化能力。

视觉的下一Token
自然语言处理能从专用模型走向通用基础模型,关键在于找到了一个统一且可规模化的训练目标,预测序列中的下一个Token。一个目标,撑起了一整个时代。从BERT到GPT再到今天的大模型,看似千变万化,底色都是这套机制。
计算机视觉并不缺强大的基础模型,只是这些模型依然带着明显的任务专用色彩。做深度估计的、做分割的、做姿态估计的,各玩各的。
构建通用视觉模型的关键,就是找到一种类似语言模型下一Token预测的通用预训练目标。视觉领域一直缺这样一个角色。
视觉预训练范式至少要满足三个条件。能学习时间演化、三维结构和物理规律;能和语言天然对齐;能随着数据、参数量和算力持续扩展。三个条件缺一不可,前一个决定模型能不能真正理解世界,中间一个决定能不能被人用语言驱动,最后一个决定能不能跟着算力一起变大变强。
大规模文本到视频生成恰好同时满足了这三个条件。要生成一段连续可信的视频,模型必须学习多样的时空先验,物体如何移动、相机怎么转、光影怎么变,画面里有什么、人在做什么,都要懂。
文生视频模型天然以语言提示为条件,并且已经获得大量产业资源投入。这几年各家大厂砸在视频生成上的算力和数据,恰好为视觉通用模型铺好了路。
视频生成或许远不止是视觉系统的一项下游能力,它本身就可以成为视觉领域的通用预训练任务。
一句指令,一套架构
GenCeption的核心思路,是直接复用经过预训练的文生视频扩散模型,把其中学到的时空先验转化为视觉理解能力。模型不需要从零开始学世界,世界知识已经在预训练阶段装进去了,剩下的只是换一种方式把它读出来。
传统扩散模型从随机噪声出发,经过多轮迭代去噪生成视频。生成方式适合造画面,深度、分割和姿态估计需要的却是稳定确定的结果,不能是带有随机性的生成样本。同一个输入跑两次,结果理应一致,不能每次都不一样。
GenCeption把多步扩散过程改造成单步前馈模型。模型不再输入随机噪声,直接接收待分析视频的无噪声潜在表示(Latent Representation),扩散时间步被固定在t=0,整个模型只做一次前向传播。
输入同一段视频时,只需改变文本指令,模型就能切换任务。
很多所谓的多任务视觉模型,虽然共享同一个主干网络,在不同任务面前依然需要使用不同的任务头和损失函数。共享的部分有限,工程上还是要为每个任务单独调一套东西。GenCeption更进一步,试图统一视觉任务的主干网络、预测头和训练目标。

任务被分成两类。密集视觉任务,包括深度、法线、分割和相机射线图等,模型把结果统一编码到标准RGB空间。不同任务都可以被表示为一种目标视频,继续沿用生成模型原本熟悉的输出形式。模型不用学新动作,只是输出对象变了。
稀疏视觉任务,包括2D、3D关键点等,模型额外加入可学习Token,再通过一个轻量级MLP(多层感知机)解码为坐标。这样一来,GenCeption既可以输出逐像素的视觉结果,也可以输出适合进一步计算和控制的坐标数据。
所有任务都使用统一的L2损失训练。任务之间的差异不再主要通过不同模型头和损失函数来体现,被转移到数据表示方式上。先通过归一化和重新编码消除不同任务的尺度与格式差异,再用统一损失优化。
任务定义不再主要体现在架构修改中,而是体现在数据格式设计中。要做新任务,先想清楚怎么把答案编码成模型看得懂的格式,架构本身几乎不用动。
例如,GenCeption能处理复杂场景,包括快速运动、严重遮挡、第一人称视角、多视角等多种挑战,可以输出4D人体关键点,对应机器人、AR/VR等真实场景。

从一个普通视频出发,它还能预测逐像素的几何和相机位姿,把整个场景抬升为4D点云,支持自由视角飞行和基于文本的物体定位。

合成数据,多任务对齐
统一视觉任务还面临另一个现实问题,数据。
真实视频数据通常只包含有限的标注模态。某个体育项目数据集可能有人体关键点,却没有动作类别。另一个数据集可能有相机轨迹,却没有时序关键帧。要把多个任务凑齐放在一个真实数据集里,几乎不可能。
为了获得能够同时支持多种任务的高质量标注,研究团队主要采用合成数据。
他们使用800个RenderPeople人物资产和200种动作,生成7500段人体视频,同步获得深度、法线、分割、DensePose、2D/3D关键点和相机位姿等标注。这些信息来自同一个三维场景,在空间和时间上天然对齐,也减少了不同数据集之间的格式冲突。
GenCeption覆盖深度、表面法线、前景分割、指代表达分割、相机位姿和3D关键点等任务。
实验显示,它在多个基准上能够接近或超过Depth Anything V3、SAM 3、D4RT、VGGT-Ω、Sapiens和Genmo等专用模型。
GenCeption同时表现出较高的数据效率。它使用约123万帧后训练数据,就能取得接近部分领先专用模型的效果。Depth Anything V3、D4RT和VGGT-Ω使用的数据规模分别约为2亿、8600万和6亿帧。

GenCeption能够以少7倍至500倍的下游训练数据,达到与部分领先模型相近的性能。
一旦拥有一个强大的视频生成基础模型,针对下游视觉任务进行适配时,所需要的专用标注数据可能大幅减少。对于标注昂贵、任务定义不断变化的专业领域,这一点尤其重要。
没教过的,它也懂
GenCeption最有意思的部分,是在训练范围之外的泛化能力。
模型的大部分后训练数据来自合成人体视频,但它能够直接处理真实视频,输出深度、法线、分割和姿态结果。合成数据训练,真实数据上跑。

而且,主要使用单人视频训练的模型,也能在多人场景中输出多个姿态实例。

模型还能把人体相关任务迁移到训练中未出现的类别。一个主要在合成人类数据上后训练的模型,可以为猩猩预测近似的人体姿态,对动物和拟人角色进行分割或姿态估计,为机器人输出具有语义对应关系的关键点。

光用7500段合成人体视频,很难解释这些能力。它们主要来自视频生成模型在大规模预训练阶段已经获得的广泛世界知识。
只要给定输入视频和用于描述期望输出结果的文本提示,模型就能完成各种复杂的视觉任务。
视觉AI正在迎来通用智能系统。
参考资料:
https://genception.github.io/
https://arxiv.org/abs/2607.09024







