Token导航 LogoToken导航TokenDH.com

香港中文大学联合华为首创“X-Stream”:当AI学会同时盯着好几块屏幕,会发生什么?

更新时间 2026-06-05来源 科技行者正文 6824字阅读约 22分钟

这项由香港中文大学多媒体实验室联合华为公司共同主导、多位独立研究者参与完成的研究,于2026年6月发表在预印本平台arXiv,论文编号为arXiv:2606.02482。感兴趣的读者可以通过该编号查阅原始论文。

**一个被忽视已久的现实**

现代人的生活早已是多屏幕并行的状态。足球世界杯转播时,导播要同时盯着四十多个机位画面,随时切换最精彩的镜头;自动驾驶汽车需要同时读取车载摄像头、雷达和导航地图;做机器人手术的医生要同时看肩部摄像头和腕部摄像头才能准确操作;甚至你和朋友视频通话时开着共享屏幕,另一端也在同时接收两路画面信息。

然而,当前几乎所有的视频AI技术,都只会盯着"一块屏幕"看。就像一个只能专注一件事的助手,你问他同时发生在两个房间里的事情,他只能摇摇头说"我没看见另一边"。这个看似简单的缺陷,实际上挡住了AI走向真正实用场景的路。

于是,研究团队决定直面这个问题。他们不仅建立了全球首个专门针对"多路视频流同时理解"的评测基准,还把现有的大模型当成一种通信设备来分析,用通信工程里的经典理论来解释它们面对多路信号时为何表现不佳、各自的优劣从何而来。这就是这篇论文的核心故事。

**一、一场早该发生的"考试"——X-Stream基准测试的诞生**

要评测一个AI能不能同时处理多路视频,首先得有一套专门的题目。过去的AI视频测试,要么只测单路视频,要么虽然给了多路视频却没有时间上的约束——就像考一个学生"看这两本书里写了什么",但不要求他边看边回答、不要求他精确记住什么时间点发生了什么事。

研究团队把这套全新的测试集命名为"X-Stream",发音像"extreme"(极限),意在强调其挑战性。整个数据集包含4220个精心筛选的问答对,涵盖932个视频、451个多路视频组合,来自八个完全不同的领域:驾驶、体育、机器人、日常生活、视频通话、监控、直播和界面交互。视频时长从5分钟到30分钟不等,平均约15.8分钟,以双路视频为主,约20%的数据包含3至5路视频同时进行。

X-Stream所涵盖的场景大体可以分成三类。第一类是"同一主体的多个拍摄角度",比如机器人手臂同时有肩部摄像头和腕部摄像头,或者运动员从侧面和门线两个角度同时被拍摄。第二类是"同一行为的多个视角",比如自动驾驶中的前视和后视摄像头,或者两个玩家分别在自己的视角下进行协作游戏。第三类是"不同设备协作完成同一目标",比如街景地图和导航地图的结合,或者车载摄像头和仪表盘同时提供信息。

这套数据集的另一个重要特点是,它要求模型在"实时流式"状态下工作,而非提前看完所有视频再慢慢想答案。具体来说,题目分为两种类型:一种是"即时题",模型在收到问题时,利用已经看过的内容立刻作答;另一种更难的"前瞻题",模型在收到问题后,必须继续盯着视频流,等到某个关键时刻出现时才能给出答案,如果答早了或者一直没回应,都算失败。这个设计模拟的就是导播等待关键进球瞬间、驾驶助手等待红灯变绿等真实场景。

**二、数据质量的守门员——双重验证流水线**

任何测试集的质量,取决于题目是否真的考验了目标能力。研究团队在构建数据时发现了一个棘手的问题,他们称之为"单路捷径"——就是说,生成的题目表面上需要结合两路视频才能回答,但实际上用一路视频就可以蒙混过关。

这种情况主要以两种方式出现。第一种叫"伪跨流参照":假设Stream 1里某人从头到尾都在"坐着",题目问"当Stream 2里门被打开时,Stream 1里那个人在做什么",答案显然随时都是"坐着",根本不需要精确对齐时间,跨流参照毫无意义。第二种叫"伪跨流协作":两路视频拍的视野大量重叠,任何一路都能看见答案,根本不需要真正融合两路信息。

为了剔除这类"假题",研究团队设计了一套双重验证流程。第一步是"充分性验证":给强力模型看完整的多路视频片段,确认它能正确回答这道题,排除因题目本身有误而导致无法作答的情况。第二步是"必要性验证":只给模型看单独一路视频,验证它是否无法正确回答——如果单路就能答对,这道题就被淘汰。只有同时通过这两关的题目,才会进入最终数据集。

除了自动验证,团队还招募了31位有视频理解经验的专家,进行两轮人工审核。每位标注者会同时看到对齐的多路视频画面、问题、预填答案和解释理由,逐一核查准确性、时间戳的合理性和答案的完整性。最终统计显示,约25.6%的条目需要人工修正,修正后准确率达到94.5%,而被修正的错误中约65%源于问题本身的表述问题,约22%源于答案错误,约13%源于时间戳标注偏差。

**三、把AI大模型想象成一台老式电话交换机**

弄清楚如何测试之后,研究团队面临的下一个问题是:现有的AI大模型应该怎么处理同时涌入的多路视频流?

这里有个根本性的限制:目前所有的大语言模型,本质上都只能处理"一路"信息——也就是说,给进去的内容必须是一个前后相继的序列,就像一本书的页码只能从第一页翻到最后一页,不能同时翻两本书。面对多路视频,就必须有某种"合并"机制,把多路信号拼成一路,再送进模型。

研究团队把这个过程类比到通信工程中的"多路复用"(Multiplexing)技术。在通信领域,多路复用是指把多个信号合并成一个信号,通过一条共享线路传输的方法,历史上发展出了频分复用、时分复用、码分复用等多种方案,每种都有各自的适用场景和固有代价。研究团队沿用了这个框架,提出了三种对应的视频流复用策略,并在此框架下系统分析了各自的得失。

第一种叫"空间分割复用"(Spatial Division Multiplexing)。做法是把两路视频在画面层面直接拼合——就像把两块拼图并排放在一张大纸上,然后整体送入模型。为了不超出模型的处理容量,每路视频的分辨率都会被等比缩小。这种方法的好处是,模型在看每一帧时,两路画面是同时可见的,跨路对比和参照非常直观,就像同时看两块屏幕;代价是每一路的画面都缩小了,细节损失是不可避免的,而且处理音频时两路声音会叠在一起,带来额外麻烦。

第二种叫"时间分割复用"(Time Division Multiplexing)。做法是把两路视频的帧按照时间顺序交替穿插,就像两队人轮流过独木桥——Stream 1出一帧,Stream 2出一帧,再Stream 1再出一帧,如此循环,同时用特殊的标识符区分每一帧来自哪路视频。这样每一帧的分辨率可以保持较高,但模型一次只能看到一路的当前画面,跨路参照需要依赖记忆,更像是把两本书交替着一页一页地翻,而不是同时摊开两本书来对照。

第三种叫"语义分割复用"(Semantic Division Multiplexing)。这是最精细也最复杂的一种。它不是简单地合并帧,而是先把每一帧视频转化成一系列"语义标记"(token,可以理解为压缩过的信息小单元),然后根据当前问题的相关性,从这些标记里选出最重要的保留下来,把不重要的丢弃,最终把两路筛选后的标记按时间顺序交织在一起。这类似于两路消息各自先经过一个"重要性筛选器",只把真正关键的信息传给后方,节省了带宽,但筛选过程本身会引入延迟,而且筛选的质量取决于筛选器本身的判断是否准确。

这三种策略各有其对应的通信工程类比:空间分割像是把不同的信号分配到同一时刻的不同"信道位置";时间分割像是不同信号轮流使用同一时间槽;语义分割则更像是对信号先做有损压缩,再交替传输。

**四、实验现场:看看现在最强的AI表现如何**

有了测试集和复用策略,研究团队就对目前业界主流的大模型进行了全面测评。参与测评的模型覆盖三类:专有闭源多模态模型(包括Gemini 3 Pro、GPT-5、GPT-4o、Doubao-Seed-1.8)、开源多模态模型(包括多个Qwen系列模型)以及专为视频流设计的开源流式模型(包括Dispider、VideoLLM-online、MMDuet2)。

测评结果相当令人警醒。在主要对比实验中,所有模型统一采用空间分割复用策略,每秒视频的处理容量上限固定为250个标记,模型以每秒1段的节奏接收视频流,同时维持一个滑动记忆窗口管理上下文。

在综合得分上,表现最好的是Gemini 3 Pro,总分约49.60分(满分100分)。GPT-5和GPT-4o分别得到27.78和22.46分。开源模型中,Qwen3-Omni-30B-A3B以34.28分领跑,Qwen3-VL-30B-A3B紧随其后得到34.19分,而专门为流式视频设计的几个开源模型表现反而更差,VideoLLM-online只有8.48分,MMDuet2仅6.79分。作为参照,研究团队还邀请人类专家做了同样的题目,人类得分达到91.84分。

单看即时题(模型有历史信息可以参考立即回答的题型),各模型表现相对较好——Gemini 3 Pro得到73.38分。但到了前瞻题(必须等待特定时刻再回答的题型),几乎所有模型都出现了灾难性的崩溃:Gemini 3 Pro只有20.77分,GPT-5只有6.51分,GPT-4o只有4.05分,而Qwen3-Omni-30B-A3B仅有0.61分。造成这种分差的原因主要有两个:一是模型太急于回答(提前响应率极高),Qwen3-Omni-30B-A3B的提前响应率高达98.81%,意味着几乎每次都没等到正确时机就匆忙开口;二是部分模型一直保持沉默从不主动响应。

从不同类型的跨流能力来看,测试结果揭示了一个清晰的能力层级。所有模型在基础感知任务(如视觉定位、音频定位、目标计数)上表现相对尚可,但在高级认知任务(如因果推理、反事实推理)上急剧下滑。在决策任务(行为规划)上,得分普遍最低,连最强的Gemini 3 Pro在这个维度也只有44.18分。

**五、三种复用方案各有什么"脾气"**

为了更深入地理解三种复用策略的差异,研究团队在Gemini 3 Pro和Qwen3-Omni-30B-A3B这两个代表性模型上做了详细的对比消融实验,得出了几个很有规律性的发现。

在跨流参照任务上,空间分割复用明显占优。因为它能让模型在单次处理中同时"看见"两路画面,跨路对比就像在同一张照片里找不同,不需要借助记忆。相比之下,时间分割和语义分割都需要模型在时间上"记住"另一路的内容再来对应,更加依赖记忆力。

在双路视频且token预算相对宽松的场景下,时间分割复用表现最佳。它没有空间压缩带来的画质损失,也不需要语义筛选带来的信息剪裁,每一帧都以较高分辨率完整保留,在两路流的场景下相对最为平衡。

然而,当视频路数增加到三路及以上时,情况发生了逆转。空间分割会让每一路画面越分越小,三路就缩成三分之一,五路就只剩五分之一,很快就变得模糊不清;时间分割同样面临每路帧率被摊薄、时间连续性被破坏的问题。反而是语义分割在这种情况下体现出了独特价值——它能从密集的多路信息中主动筛选出最关键的内容,有效对抗信息过载。

在音频方面,空间分割有个特殊的麻烦:两路视频的音轨会直接叠加在一起,产生混音,就像把两首歌同时播放,很难辨认其中任何一首;时间分割虽然解决了混音问题,但交替切换会导致语音句子被切碎、语义连贯性遭到破坏。总体来看,有音频处理能力的模型在音频定位任务上表现显著更好,但音频的复用问题比视频更棘手,目前简单的方案都有明显局限。

流数量的影响同样被系统测量。从双路到五路,几乎所有方案的得分都呈现下降趋势。双路场景下,Gemini 3 Pro用时间分割可以达到约58分;到了五路场景,最好成绩也不超过31分。语义分割在四路场景下的相对韧性最为突出,但也只是"相对更好",并非真正的解决方案。

**六、多路处理到底是真需求还是伪命题**

有人可能会问:能不能直接把多路视频堆在一起喂给模型,当作"增强了的单路"来处理?或者反过来,把单路处理系统直接扩展到多路?研究团队专门设计了实验来回答这个问题。

他们做了两组对照。第一组:把原本只有一路视频的其他测试集的视频,加入干扰视频合成"伪多路",然后分别用单路和多路输入方式测试模型。结果显示,在单路测试集上本来能得57分的模型,一旦加入了干扰视频流,得分立刻跌到26分。这说明多路处理的干扰问题是真实存在的,当前模型对无关视频流的噪声抵抗力极弱。

第二组:把X-Stream的多路测试换成只给单路视频输入,结果模型得分从34分暴跌到5.35分,几乎完全不能作答。这证明X-Stream的题目确实依赖多路信息才能作答,不存在被单路捷径解决的情况,数据集的设计目标得到了验证。

**七、为什么专为流式视频设计的模型反而更差**

看到那些专门为流式视频设计的模型(如VideoLLM-online、MMDuet2、Dispider)整体表现远低于通用多模态大模型,可能让人有些困惑。这背后的逻辑并不复杂:流式视频模型的设计重点在于高效地处理单路连续视频、在合适时机主动响应,但它们通常使用规模相对较小的基础模型,训练数据也主要针对单路场景,对多路并发的跨流推理能力几乎没有专项训练。当它们面对必须同时理解两路以上视频流的题目时,底层的理解能力就成了瓶颈。

通用大模型虽然没有专门的流式训练,但凭借更强大的基础理解和推理能力,反而在即时题上表现更好。代价是它们在主动性(知道什么时候该开口)上普遍较差,前瞻题的表现一塌糊涂。这揭示了一个目前还没有被很好解决的矛盾:强大的理解能力和精准的时机判断能力,在现有的训练范式下很难同时兼得。

**八、这项研究还发现了一个"垂直比水平好"的有趣细节**

在探索空间分割复用时,研究团队还测试了不同的拼图方式:是把两路视频左右并排(水平拼接)好,还是上下叠放(垂直拼接)好?结果显示,垂直拼接始终优于水平拼接,两种配置下的得分差距可以达到3到4分。

这个看似细微的发现,有一个有趣的原因。现代视觉大模型在处理图像时,会把画面切成一个个小方块,然后按照从左到右、从上到下的顺序"扫描"这些方块,生成一个线性序列——就像古人读竹简,一行一行地读。如果两路视频是水平并排的,扫描时同一行就会把两路视频的内容交织在一起,边界信息会相互"污染"。而垂直拼接时,扫描时先完整扫完一路再扫另一路,两路信息在序列中保持了更好的分隔,模型更容易理解哪部分内容来自哪路视频。这个细节对于未来设计多路视频处理系统,有着实际的工程参考价值。

**归根结底,这项研究告诉我们什么**

说到底,这篇论文做了一件颇有意义的工作:它正视了一个长期被忽视的能力空白,给它建了测量尺,然后用这把尺量了一遍业界最强的AI,发现它们普遍只有一半左右的水平。即使是目前公认最强的Gemini 3 Pro,综合得分也不过五十分,距离人类的九十分还有很大差距,而在需要等待最佳时机再开口的前瞻任务上,几乎所有模型都惨不忍睹。

三种复用策略各有所长、各有所短的发现,呼应了通信工程里已经被验证了几十年的一个基本规律:没有哪种单一方案在所有条件下都是最优解,实际效果取决于信道带宽(在这里是模型的token处理容量)、信号路数(视频流的数量)和任务特性(是需要跨路参照还是跨路协作)的具体组合。这对于未来专门设计多路流式AI系统的工程师来说,是一份颇具参考价值的"使用说明"。

对于普通用户来说,这项研究的意义在于:你未来使用的AI助手——无论是帮你监控家里多个摄像头、协助你在直播时同时处理游戏画面和表情画面、还是辅助自动驾驶理解多路传感器——能做到什么程度,目前处于什么水平,都有了一把更清晰的量尺。也正因为有了这把量尺,改进的方向才能更加明确。

如果你对这项研究的完整技术细节感兴趣,可以通过论文编号arXiv:2606.02482查阅原始文献,数据集和评测代码也已随论文公开发布。

Q&A

Q1:X-Stream基准测试和普通视频AI测试有什么区别?

A:X-Stream是全球首个专门针对多路视频流同时理解的测试基准,要求模型在"实时接收"的状态下同时处理多路视频,而不是看完整视频再回答。它还特别引入了"前瞻题"类型,要求模型等到特定时刻出现才能作答,模拟真实场景中的导播、驾驶辅助等需求。普通视频测试通常只有单路视频,也不要求实时性。

Q2:三种视频流复用策略分别适合什么场景?

A:空间分割复用(两路画面拼合)最适合需要跨路对照参考的任务;时间分割复用(两路帧交替输入)在双路视频且处理容量宽裕时综合表现最好;语义分割复用(先筛选重要信息再合并)在三路及以上视频流或处理容量严格受限时最能保住关键信息。没有哪种方案在所有场景下都占优。

Q3:现有AI大模型在多路视频流处理上的最大短板是什么?

A:当前模型最突出的弱点有两个:一是在需要等待特定时刻再作答的"前瞻任务"上几乎全面崩溃,大多数模型要么提前抢答、要么一直沉默;二是在因果推理、反事实推理等高级跨流认知任务上得分极低,即使最强的Gemini 3 Pro在决策任务上也只能得到44分左右。

文章标签大模型学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多