Token导航 LogoToken导航

腾讯研究:多模态大模型是否仍需视觉编码器

更新时间 2026-10-08来源 科技行者正文 7347字阅读约 23分钟

先问你一个问题。如果让你造一辆车,你会怎么设计发动机和轮子的关系?

传统思路是分开做:发动机专门负责产生动力,轮子专门负责把动力转化成位移,两个部件各司其职,分工明确。这几乎是所有多模态大模型的默认做法。你给模型看一张图,图片先经过一个专门训练好的“视觉编码器”,把像素变成语言模型能理解的语义特征,然后语言模型再基于这些特征去理解、去回答问题。这套分工体系已经运行了很多年,几乎成了行业共识。

但2023年前后,一些研究者开始琢磨一件事:能不能把发动机和轮子做成一体?直接把图像的原始像素扔给语言模型,让语言模型自己去学会“看”图片,不再依赖那个专门的视觉编码器。这类模型被称为“编码器无关”架构,听起来有点激进,因为这意味着语言模型要同时干两份工作:既要学会处理语言,又要从零学会处理视觉。

这就带来一个很现实的问题:这样做值不值?在小规模实验里,去掉视觉编码器的模型表现往往会打折扣,这也是过去几年里编码器无关架构一直没能成为主流的原因之一。但问题是,所有这些对比实验都是在相对较小的算力规模下做的。如果把模型做得更大、训练数据喂得更多,这个差距会不会缩小,甚至反超?

这正是腾讯这篇论文想要回答的问题。他们没有满足于训练几个模型跑个分对比一下,而是做了一件更系统的事:严格控制变量,训练了一整个系列共11个模型(参数量从11亿到440亿不等),一半用视觉编码器,一半不用,其余条件完全一致,然后观察随着算力投入增加,两种架构的表现曲线会怎么变化。这种研究方法叫“缩放定律”研究。

缩放定律:通过在小规模模型上系统性地做实验,拟合出一条数学曲线,用来预测当模型规模、数据量、算力继续增大时,模型的表现会如何变化。这个概念最早在OpenAI和DeepMind的语言模型研究中被广泛使用,核心思路是“用可控的小规模实验,去预判难以直接验证的大规模结果”。

一、先搞清楚,这场“军备竞赛”到底在比什么

要理解这篇论文,得先明白视觉编码器到底在做什么活。

拿现在主流的多模态大模型来说,比如Qwen3-VL、Gemma 3,它们的图像处理流程通常是这样的:图片先经过一个叫SigLIP或者CLIP的专门模型,这个模型此前已经在海量图文对上训练过,学会了把图像转化成富含语义的向量表示。这些向量再经过一个“投影层”,转换成语言模型能读懂的格式,最后交给语言模型去理解和生成回答。

视觉编码器:一个专门负责把图像像素转换成语言模型可理解的语义向量的神经网络模块,通常基于ViT(视觉Transformer)架构,在多模态模型训练之前就已经在大规模图文数据上预训练好,为语言模型提供“现成的视觉理解能力”。

这套流程的好处很明显:视觉编码器专业对口,出厂自带视觉理解能力,语言模型接手的时候不用从零学起。缺点也很明显:架构变复杂了,两个模块要对接、要协调,而且视觉编码器的能力上限,某种程度上框定了整个系统的视觉理解天花板。

编码器无关架构想解决的就是这个复杂度问题。它把图像切成小块,做一个简单的“打包”处理(比如把原始像素块通过几层归一化和线性变换),直接喂给语言模型,剩下的活全部交给语言模型自己去悟。听起来简单粗暴,但问题是,语言模型原本是为处理文字序列设计的,现在要它额外学会“看图”,这个负担有多重,谁也说不清楚。

这就好比你本来只雇了一个厨师负责炒菜,现在打算让这个厨师同时负责种菜、采购、洗菜、切配全流程包办,不再额外雇一个专门的备菜师傅。短期看,厨师手忙脚乱肯定做不过有备菜师傅配合的团队,出品质量会下降。但如果给这个厨师足够长的时间练习,足够多的实践机会,他会不会最终练出一手全能的绝活,甚至比分工模式更高效?这就是这篇论文要用数据回答的问题。

论文里给出一个关键的时间节点参照:像Kimi K2.5这样的旗舰模型,预训练算力大约是10的25次方FLOPs(浮点运算次数)。这个数字先记住,后面会用到。

FLOPs:全称是浮点运算次数,是衡量计算量的基本单位。训练一个大模型需要进行海量的加减乘除运算,FLOPs就是把这些运算次数加总起来的度量,数值越大,代表投入的算力越多。

二、去掉编码器之后,模型的“胃口”变了

论文的第一个核心发现有点反直觉:去掉视觉编码器之后,语言模型在处理纯文本任务时几乎没有变化,但在处理多模态任务时,最优的模型大小选择彻底变了。

研究者用了一种叫“IsoFLOP”的实验设计方法。简单说,就是固定一个总的算力预算,然后在这个预算内,尝试不同的模型规模和训练数据量组合,看哪种搭配能把损失(也就是模型犯错的程度)降到最低。重复这个过程,换不同的算力预算再做一遍,就能画出一条“在每个算力水平下,最优模型应该多大”的曲线。

这条曲线的形状用一个指数来描述,研究者称之为“模型分配指数”,用字母a表示。a越大,意味着当算力增加时,你应该把更多的算力投入到把模型做大,而不是喂更多数据。

结果显示:在纯文本任务上,有编码器和没编码器的模型,这个指数几乎完全一样,一个是0.422,一个是0.427,差距小到可以忽略。但在多模态任务上,去掉编码器之后,这个指数从0.464跳到了0.570。

这个跳跃意味着什么?意味着编码器无关模型需要更大的“脑容量”才能把视觉任务处理好,而不能简单地靠喂更多数据来弥补。研究者甚至换了一种视觉token的处理方式(从双向注意力换成单向因果注意力)重新做了一遍实验,指数依然从0.427涨到了0.557,说明这个现象不是某个具体设计细节导致的偶然结果,而是一个比较稳固的规律。

这就好比你原本雇了一个专业侍酒师帮你挑酒,现在取消这个岗位,让主厨自己兼职选酒。主厨确实可以学会品酒,但要学到能独当一面的水平,光靠加班加点(相当于喂更多数据)是不够的,他需要更强的综合能力储备(相当于更大的模型规模)才能同时把菜做好、酒选对。如果不给主厨足够的“脑容量”升级,硬让他兼职,出品质量必然要打折扣。这也是为什么编码器无关模型在小规模时容易表现不佳,因为如果还按照有编码器时的“身材”来配置模型规模,它根本撑不起额外的视觉学习任务。

三、追赶的时间表:大约在10的22次方FLOPs处

搞清楚了“怎么分配算力”,下一个问题自然是:编码器无关模型到底能不能追上有编码器的模型?如果能,什么时候追上?

论文给出的答案分两部分看。

在纯文本任务上,两种架构的损失曲线几乎完全重合。研究者拟合出的损失衰减速度(指数γ)分别是0.0973和0.0979,差异微乎其微。这说明去掉视觉编码器,对语言模型本身处理文字的能力,基本没有拖累。这也印证了一件事:语言能力和视觉能力在这个架构里是相对独立的两套系统,砍掉视觉编码器主要冲击的是视觉那一侧,不太会连累语言这一侧。

在多模态任务上,情况就有意思了。在研究者能测量到的算力范围内(大约10的20次方到10的21次方FLOPs),编码器无关模型的损失确实一直高于有编码器模型,也就是说表现更差。但是,它的损失下降速度更快:损失衰减指数达到0.3778,而有编码器模型只有0.2998。这意味着随着算力持续增加,编码器无关模型是在用更快的速度追赶。

把这两条曲线往后延伸,会在哪里相交?研究者算出来的答案是大约6.1×10??次方FLOPs,用一种叫“条件自助法”(一种统计学上估计不确定性区间的方法)估计出的置信区间是4.2×10??到1.0×10??FLOPs,也就是量级上在10的22次方FLOPs左右。

记不记得前面提到的参照系?Kimi K2.5这类旗舰模型的预训练算力大约是10的25次方FLOPs。也就是说,这个交叉点比现在顶尖模型实际投入的算力,整整低了三个数量级,大约相当于一千分之一。换句话说,这个追赶节点并不是遥不可及的理论极限,而是在现有工业界的实践范围之内完全可以触达的。

这个结论如果放到实际部署场景,还得考虑另一种常见做法:“过度训练”。很多实际部署的模型,为了压低推理时的成本,会故意把模型规模固定住,然后拼命多喂训练数据,这样模型虽然“绝对最优”不是最好的,但推理时更便宜。研究者也测试了这种情形,在训练数据量翻5倍的过度训练条件下,交叉点会往后推迟到大约1.2×10??FLOPs,量级依然维持在10的22次方,只是稍微晚一点到达。这就好比原本计划健身三个月能追上对手的体能,但如果中途改变策略、增加了别的训练负荷分散了精力,可能要拖到四个月才追上,方向没变,只是节奏慢了一点。

四、不同任务,追赶节奏完全不一样

如果只看整体的多模态损失,容易忽略一个细节:多模态任务本身五花八门,有的偏重理解文字和符号,有的高度依赖对真实世界画面的精细感知。研究者把整体损失拆解到具体的任务类别上,结果发现追赶速度差异巨大。

按照追赶速度从快到慢排序,依次是STEM(科学、数学类,包含大量文字符号和简单图表)、图表理解、GUI操作(图形界面理解)、OCR(文字识别)、看图说话。在STEM任务上,编码器无关模型在实验测到的最大算力点已经几乎追平了有编码器模型;而在看图说话这种需要理解自然图像丰富细节的任务上,差距缩小得慢得多。

这个规律背后的逻辑其实很朴素。STEM和图表类任务里的图片,很多时候本质上是符号系统,一旦模型把符号信息提取出来,剩下的推理主要靠语言能力就能搞定,视觉编码器带来的优势没那么关键。但看图说话、GUI操作、OCR这类任务,高度依赖对图像细节的精确捕捉,比如一张照片里光影的层次、界面里按钮的精确位置、文档里字体的细微差异,这些恰恰是预训练视觉编码器最擅长提供的“先验知识”,编码器无关模型必须从零摸索,自然要花更长时间才能追平。

打个比方,这就像两个人同时学做菜,一个从小跟着家人做饭长大,对火候和调味有天生的直觉(相当于预训练视觉编码器),另一个完全零基础自学。如果只是做西红柿炒鸡蛋这种步骤简单、容错度高的菜(对应STEM任务),零基础的人练几次也能追平。但如果是要求极其精细的分子料理(对应看图说话这种高感知要求的任务),零基础的人可能要花更久才能达到同等水准,因为这里面依赖的是长年累月积累下来的手感,不是短时间内靠反复练习就能补齐的。

五、语言模型是怎么“自学成才”偷学视觉编码器那一套的

前面讲的都是宏观的损失曲线,研究者还进一步打开了模型内部,想看看去掉视觉编码器之后,语言模型内部到底发生了什么变化,才让它能勉强扛起视觉理解的担子。

这部分的发现挺有意思,一共有四个层面。

第一个现象是训练过程中出现的“顿悟”式跃迁。有编码器的模型,多模态损失曲线下降得很平滑,符合大家对训练过程的一般预期。但编码器无关模型不是这样,它前期损失下降得很慢,然后在某个训练节点突然出现一次陡降。研究者去查看模型内部的注意力分布,发现在损失陡降前后,模型对视觉token的注意力权重从0.217猛增到0.645,一下子接近了有编码器模型的水平。

这背后的解释挺符合直觉:因为训练时的损失只作用在文本token上,视觉token本身不直接被监督,它们能不能学到有用的东西,取决于文本token“愿不愿意”去关注它们。训练初期,视觉token里啥有用信息都还没有,自然没人愿意搭理它们,于是学习信号稀疏,进展缓慢,这是一个先有鸡还是先有蛋的困境。直到某个时刻,视觉token积累了足够的信息量,开始变得“值得被关注”,注意力一下子涌入,学习速度随之加快。而有编码器的模型从一开始就自带这份现成的视觉信息,不需要经历这个摸索期。

这就好比一个新人刚加入团队,一开始没人愿意找他开会讨论,因为大家默认他啥都不懂,说了也白说。但如果这个新人自己憋着劲儿默默积累了一段时间的专业知识,某一天突然在会议上提出一个特别有见地的观点,从那以后大家开始主动来找他讨论。如果团队一开始就有专家坐镇(相当于预训练视觉编码器),这个从被冷落到被重视的过程根本不会发生,效率自然更高,但也失去了让新人自己摸索成长的机会。

第二个现象是双向注意力的价值随着算力增长而提升。

在传统的语言模型里,一个词只能“看到”它前面的词,这叫因果注意力,是为了保证语言生成时逻辑通顺(不能提前偷看未来要说的话)。但图像不一样,一张图片里各个区域之间的关系是同时存在的,没有先后顺序,所以视觉编码器内部通常用的是双向注意力,图像各个部分互相看得见彼此。

双向注意力:一种让序列中每个位置都能同时看到前面和后面所有位置信息的注意力机制,与只能看到前面信息的“因果注意力”相对,常用于图像这类没有天然时间顺序的数据。

研究者对比了编码器无关模型使用双向注意力和纯因果注意力两种设置,发现在纯文本任务上,因果注意力反而略微更好(省大约1%的算力就能达到同等效果),但这个优势随算力增长在缩小。而在多模态任务上,双向注意力的优势随着算力增加变得越来越明显。这个结果说明,去掉视觉编码器之后,语言模型开始靠视觉token之间的双向互相“打量”,来补上原本由视觉编码器提供的整体图像理解能力,而且模型规模越大,这种互相打量带来的好处就越大。

第三个现象更微妙,是关于视觉信息在模型内部“何时开始被改写”的问题。

研究者比较了每一层decoder输出的表示,和最初输入表示之间的相似度。在有编码器的模型里,因为视觉token在进入语言模型之前已经被视觉编码器处理成高度语义化的向量,所以进入decoder的浅层时,这些向量变化不大,改动主要发生在更深的层。但在编码器无关模型里,视觉token从很浅的层就开始大幅度偏离原始输入,变化发生得早得多。而文本token在两种架构里的变化轨迹基本一致。

这说明什么?说明编码器无关模型的浅层网络,实质上充当了一个隐式的视觉编码器,把这部分原本该由专门模块承担的工作,挪到了语言模型自己的前几层里去做。

第四个现象和模型内部的“专家路由”机制有关,这需要先解释一下背景。

论文里用的语言模型采用的是一种叫MoE(混合专家模型)的架构,模型内部有256个“专家”子网络,每次处理一个token时只激活其中8个,就像一个大型专家团队,遇到不同问题时挑最合适的几个专家来处理,而不是让所有人都上阵。

MoE(混合专家模型):一种神经网络架构,内部包含很多个功能相对独立的子网络(称为“专家”),处理每个输入时只激活其中一小部分专家参与计算,既能扩大模型总容量,又能控制实际计算开销。

研究者用一个叫MaxVio的指标来衡量专家负载是否均衡,数值越大代表某些专家被“偏爱”得越厉害,负载越不均衡。结果发现,把文本token和视觉token的路由分开看之后,文本token在两种架构里的负载分布高度接近,但视觉token的负载分布在编码器无关模型里明显更集中,也就是说某些特定的专家被更频繁地征用去处理视觉信息。这个结果和前面的发现连在一起看,指向同一个结论:编码器无关模型正在用自己内部的一部分资源,专门划拨出来充当“临时视觉编码器”的角色,只不过这次不是一个独立的外部模块,而是模型内部自发形成的分工。

六、下游任务上的验证:不是纸上谈兵

光看损失曲线容易让人怀疑,这些数字游戏是不是脱离实际?研究者也做了下游基准测试的验证,涵盖了感知能力(比如物体计数、空间关系判断)、文档理解(图表问答、文档问答、场景文字识别)、通用视觉问答等多个维度,一共11个主流评测集。

结果和损失曲线的趋势一致:在测试的算力范围内,编码器无关模型的平均得分确实低于有编码器模型,但差距随着训练算力增加在缩小。举个例子,在大约100B训练token的节点上,最小的6.1B模型两者平均分差了8个百分点,而到了22B模型规模,差距缩小到9个百分点左右(因为编码器无关模型的绝对分数也在提升),整体呈现出随规模扩大差距收窄的趋势,和前面损失曲线的结论互相印证。

写在后面

读完这篇论文,最触动我的不是那个10的22次方FLOPs的交叉点数字本身,而是研究者花了大量篇幅去拆解“为什么”会出现这个交叉,而不是止步于给出一个预测结果就收工。这种打开黑箱去验证机制的做法,在缩放定律这类偏统计规律的研究里其实不算常见,很多论文满足于拟合出一条漂亮的曲线就结束了。

顺带说一句,也有一些工作走的是完全不同的路子。比如论文提到的NaViL和一些后续研究,讨论的是视觉编码器和语言模型能不能联合缩放,也就是不固定编码器大小,让两边一起变大。这和本文的实验设定是互补的两个方向,一个假设编码器规模不变,专注研究decoder该怎么长大;另一个探索编码器要不要跟着一起长大。这提醒我,缩放定律研究本身也有很多种“控制变量”的选法,选哪个变量固定、哪个变量变化,会导向完全不同的结论侧重点,读这类论文时得先看清楚作者到底固定了什么。

还有一个细节值得单独说一下:训练过程中那次损失突然陡降的现象,如果没有专门去查注意力权重的变化,很容易被当成训练不稳定的噪声一带而过。但研究者较真地去查了原因,发现这背后其实是一个自监督信号稀疏导致的“先有鸡还是先有蛋”困境的具体体现。这种愿意较真去解释反常现象的态度,可能比结论本身更值得学习。

那么,如果语言模型真的能靠自己练出一身视觉本领,我们还需要给它单独配一个视觉编码器吗,还是说未来的方向会走向让一个模型什么都自己学,什么都不假手于人?

Q&A

Q1:编码器无关多模态大模型和传统的编码器架构多模态模型有什么区别?

A:传统架构先用一个预训练好的视觉编码器把图像转成语义向量再交给语言模型处理,编码器无关架构直接把图像像素块投影后喂给语言模型,让语言模型自己学会理解视觉信息,省掉了单独的视觉编码器模块。

Q2:编码器无关模型什么时候能追上传统的编码器架构模型?

A:论文预测在计算最优分配下,交叉点大约出现在10的22次方FLOPs量级,在5倍过度训练场景下会推迟到略高的算力水平,两者都远低于当前旗舰模型约10的25次方FLOPs的实际训练算力。

Q3:去掉视觉编码器后,语言模型是怎么弥补视觉理解能力的?

A:语言模型会在浅层网络提前改写视觉token的表示,相当于自己承担起隐式视觉编码的工作,同时增强视觉token之间的双向注意力交互,并让内部一部分专家网络专门负责处理视觉信息,相当于自发形成了内部分工。

文章标签腾讯大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多