Token导航 LogoToken导航TokenDH.com

AI机器人真的“看懂”数字了吗?西北大学等多校联合研究揭开视觉语言模型的空间盲区

更新时间 2026-06-16来源 科技行者正文 6526字阅读约 21分钟

这项由美国西北大学、加州大学圣地亚哥分校、南加州大学和佐治亚理工学院联合开展的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.23898,感兴趣的读者可以通过该编号查阅完整内容。

**一个你可能从未想过的问题**

当你把一张地图给朋友看,告诉他"那张椅子在坐标(2.2, 0.5)的位置",他能准确找到那把椅子吗?对人类来说,这需要理解坐标系、方向感,以及数字所代表的具体空间距离。这件事听起来不难,但对于如今越来越多被部署在机器人、无人机、智能家居中的AI"大脑"——视觉语言模型(VLM,一种能同时理解图像和文字的AI系统)——来说,却可能是一道难以逾越的坎。

这支来自多所顶尖高校的研究团队开始怀疑一件事:当这些AI模型输出"向左旋转20度"或者"椅子在坐标(2.2, 0.5)"这样的数字时,它们真的"理解"这些数字在空间中的含义吗?还是仅仅在模仿人类的语言模式,随机抛出一个听起来合理的数字?

带着这个疑问,研究团队构建了一套名为SPACENUM的测试框架,对18个主流AI视觉语言模型展开了系统性的"空间数字理解"大考。结果相当出乎意料——这些模型的表现,有时甚至还不如随机猜答案。

**一、这些AI模型到底在做什么**

为了理解研究的意义,先来思考一个日常场景。假设你在一个陌生的房间里,闭上眼睛,被告知"向右转30度,然后向前走1.5米",你能大概感受到自己会走到哪里吗?即便估算不完全精确,你的大脑会调用对角度和距离的基本空间感知来指导行动。

视觉语言模型正在被越来越多地用于类似的任务中。在空间探索场景里,一个AI机器人可能需要输出"向左旋转20度"这样的指令来调整自己的视角;在空间理解场景里,AI可能需要生成一张认知地图,用坐标描述房间里各个家具的位置,比如"床:左下角(0,0)到右上角(1.2,1.8)"。

这两种场景看起来截然不同,但它们有一个共同的本质要求:AI必须真正懂得这些数字在空间中意味着什么。一个旋转20度和旋转40度,视觉效果是完全不同的;一把椅子在坐标(2.2, 0.5)和(0.5, 2.2),它们在房间里的位置是相差甚远的。这种将数字与空间现实对应起来的能力,就是研究团队所说的"空间数字理解"。

**二、研究团队如何设计这场"大考"**

研究团队搭建了两套完全不同的考题系统,就像为不同年级的学生设计了不同难度的数学考卷。

第一套考题聚焦于"动态转换",也就是考查AI对运动指令中数字的理解。数据来自一个叫AI2-THOR的虚拟室内环境模拟器,在里面,AI机器人可以执行前进、后退、左移、右移,以及上下左右旋转等各种动作。每个动作都有对应的数值范围:移动类动作在0.2到2.4米之间,旋转类动作在10到70度之间,步长分别为0.2米和10度。为了保证数据质量,研究团队做了细心的筛选:每个画面必须包含至少3个可识别的物体,以确保有足够的视觉参照;同时还通过占用地图确保动作前后的场景都是有意义的真实状态,而不是撞墙或者走进空白区域。

第二套考题聚焦于"静态布局",考查AI能否从一张照片或一份坐标地图中理解物体的空间关系。场景在NVIDIA的Isaac Sim模拟器中构建,使用了真实质感的3D资产。每个场景有两个固定的"锚点"物体来定义坐标系,然后放置第三个物体,通过改变它的位置、大小,或者两者同时改变来创造不同的测试情境。为了全面评估,研究团队还设计了一维、二维和三维三种不同复杂度的坐标表示方式,并包含了桌面级别和房间级别两种不同空间尺度的场景。

两套考题都从两个方向来考查AI:"数字到空间"(NUM2SPACE,给出数字让AI判断对应哪个视觉场景)和"空间到数字"(SPACE2NUM,给出视觉场景让AI推断对应的数字)。这就好比给一个人出题:一道题是"这是什么声调,唱出对应的音阶",另一道题是"听这个音阶,说出是什么声调"。最终,整套SPACENUM基准测试包含3800道题目,涵盖动态转换和静态布局两大类,两个方向,多种动作类型和空间维度。

**三、令人意外的考试成绩单**

测试结果出炉时,研究团队大概也捏了一把冷汗。如果一道题有4个选项,纯靠随机猜测,正确率是25%到30%左右。然而,在这次测试中,表现最好的模型——Qwen2.5-VL-72B,这是一个拥有720亿参数的超大型模型——平均正确率也仅仅达到了39.8%。这意味着在最好情况下,模型的正确率也只比随机猜测高出大约10个百分点。更让人瞠目的是,有几个模型的表现甚至低于随机猜测的水平,正式宣告自己"还不如掷骰子"。

在动态转换类题目上,18个模型普遍表现低迷,无论是前进后退、左右移动,还是各方向旋转,成绩都在25%到44%之间打转,没有哪种动作类型让模型表现特别突出,也没有哪个模型展现出针对某类动作的特别擅长。这种"全面普通"本身就说明了问题——模型并没有真正理解动作数字与视觉结果之间的关系,而只是在做无差别的猜测。

静态布局类题目则呈现出更有规律性的分层特征。一维坐标场景(最简单,只需理解一个方向的位置)和桌面尺度场景中,模型表现相对好一些,有些达到了60%以上。但一旦题目升级到二维、三维坐标,或者换成房间级别的大空间,成绩便急剧滑落,多数模型只能与随机猜测水平持平。这说明空间复杂度的增加会系统性地让模型的理解能力崩溃,模型并没有掌握可以应对不同复杂度的通用空间数字推理能力。

**四、大模型犯的错,至少错得更"精准"**

虽然大家都考得不好,但研究团队发现了一个细微但重要的差异:模型越大,犯的错误往往越接近正确答案。

在动态转换任务中,研究团队设计了一套更精细的评分系统,而不是简单的对错二分法:答对得100分,猜到数值相近的答案得70分,猜到较远的得40分,猜到完全错误的得0分。按照这套评分体系,随着模型参数规模增大,平均分也在稳步提升,即便精确命中率的提升并不明显。这就好比一个射击运动员,也许还没学会每次都打中靶心,但随着训练,至少已经能稳定打在靶纸范围内,而不是打偏到墙上去。

在静态布局任务中,研究团队还分析了错误的类型。他们发现,模型犯的错误很少是单一的——要么只错了位置,要么只错了大小——而是往往位置和大小同时出错。这种"联动性错误"背后的原因很有意思:它说明当模型无法建立起正确的空间认知框架时,错误会像多米诺骨牌一样在各个维度同时倒下。模型并没有在精确感知每个独立的空间属性,而是在做某种粗糙的"整体印象匹配",一旦整体印象出错,所有细节都跟着错。

**五、让AI"多想想"有用吗**

一个很自然的疑问是:如果让AI在回答之前先写出推理过程,会不会有帮助?毕竟,很多复杂问题对人类来说,只要多思考一步就能豁然开朗。

研究团队对比了多个模型在"开启推理模式"(让模型生成思维链,一步步推导答案)和"直接回答模式"(不生成推理过程,直接给出答案)下的表现。结果却令人意外地令人失望:两种模式的性能差异通常不超过1%,几乎可以忽略不计。

为了弄清楚推理到底哪里出了问题,研究团队仔细阅读了模型生成的推理过程,归纳出几种典型的失败模式。

第一种失败叫做"过早止步"。模型往往能正确识别出某个关键的视觉线索,比如"画面左侧多出了一个木雕",然后就直接选了对应的答案。但正确的解法需要再多一步:比较各个候选答案中物体位移的幅度,判断哪个移动距离对应了题目给出的旋转角度。模型找到了线索,却没走完从线索到答案的最后一步。

第二种失败叫做"只看变化,不看不变"。在需要估算旋转幅度的题目中,正确的推理思路应该是:如果旋转角度很小,那么大多数物体在前后两张图中应该位置几乎没变;如果旋转角度很大,场景差异应该非常明显。但模型往往只注意到"有东西变化了",然后就断定"变化很大,所以旋转角度很大",完全忽略了那些稳定不变的部分所提供的关键信息。

第三种失败叫做"用图像坐标代替场景坐标"。在静态布局任务中,模型需要根据两个锚点物体建立场景坐标系,然后在这个坐标系中描述第三个物体的位置。但模型经常偷懒,直接用图片本身的左右上下来代替场景坐标,比如"这个钢琴在图片的左边,所以它的x坐标比较小"。殊不知,场景坐标系是由任务定义的,可能与图片方向完全不同。

这三种失败模式共同揭示了一个核心问题:推理过程本身是存在的,模型也知道应该推理,但推理的内容是浅薄的、基于表面特征的,缺乏真正的空间数字校准能力。让模型多说几句话,并不能让它真正懂得空间。

**六、视觉对动态任务更关键,语言对静态任务更关键**

研究团队还设计了一个巧妙的"蒙眼测试":把所有图片替换成全黑图像,只保留文字描述,看模型在没有视觉输入的情况下表现如何。

结果揭示了两类任务的本质差异。在动态转换任务中,去掉图片后模型成绩大幅下跌,说明这类任务高度依赖视觉信息——毕竟,判断旋转了多少度,本来就需要观察画面的变化。而在静态布局任务中,去掉图片后的影响要小得多,说明模型在静态布局任务中很大程度上依赖的是语言侧的先验知识和模式匹配,而不是真正在看图理解。

换句话说,在静态布局任务中,模型其实是在玩文字游戏——它在用语言知识猜测哪个坐标描述更像"正常的室内布局",而不是真的把数字与图中物体的实际位置对应起来。这也解释了为什么遮住图片对静态布局任务影响较小:模型本来就没怎么用眼睛。

在动态转换任务中,研究团队还发现了一个有趣的方向性不对称现象。对于同一种动作类型,"从场景到数字"(给图判断旋转了多少度)的表现几乎总是好于"从数字到场景"(给出旋转角度,判断结果是哪张图)。这说明让模型"描述观察到的变化"比让它"预测未来的视觉结果"要容易得多——前者是描述已发生的事,后者需要真正在内心模拟空间变换,而这恰恰是模型所欠缺的能力。

最后,研究团队还做了一个"旋转对称性"测试:如果向左转20度和向右转340度在几何上是等价的,那么模型对这两种等价描述的判断应该一致。但实际上,模型面对等价变换时的表现大幅下降,说明它的视觉到数字的映射连基本的几何一致性都没有保证,更谈不上稳定的空间理解。

**七、改变输入,能解决问题吗**

研究团队还做了一系列"干预实验",试图找到让模型表现更好的方法。

第一类干预是改变视觉输入。对动态转换任务,研究者在图片中加入了明显的视觉锚点,帮助模型衡量空间变化;对静态布局任务,则减少场景中无关物体的数量,让需要判断的目标更突出。然而,这些修改带来的效果微乎其微,而且方向不一致,有的模型稍微好了一点,有的反而略有下降。这说明问题不在于图片太复杂或参照物太少,而在于模型本身缺乏处理空间数字的核心能力。

第二类干预是改变数字的表达方式。把数字从小数变成整数(比如把"1.5米"换算成"150厘米"),或者把数字变成文字描述(比如"一点五米"),这些改变对模型表现的影响同样微乎其微。说明问题不在于模型读不懂数字的表面形式,而在于它无法理解数字背后的空间含义。

第三类干预则发现了一些真正有用的线索。研究团队把静态布局任务中的真实图片替换为越来越抽象的结构化表示:先是用点标记物体位置,再是用二维矩形框,最后是用三维立方体框。这种替换让"从空间到数字"(SPACE2NUM)任务的成绩显著提升。这个发现很有说服力:当复杂的视觉信息被简化为结构化的几何表示后,模型能更好地完成数字推断。也就是说,模型的核心瓶颈在于从原始视觉图像中提取结构化空间信息这一步,一旦这一步被人工替代,后续的数字推断能力反而还凑合。

**八、通过训练,能部分弥补这个缺陷吗**

尽管测试成绩惨淡,但研究团队并没有就此放弃,而是进一步探索了通过针对性训练来改善模型的可能性。他们额外生成了超过7.7万条训练样本,并对几个代表性模型进行了微调训练。

训练结果揭示了一个清晰的规律:用某种维度(比如一维坐标)的数据训练,主要提升的是同一维度的表现,不同维度之间的迁移效果有限。这就好比专门练习平面地图阅读,虽然对立体空间理解有一定帮助,但帮助程度并不大。不过,在更大的模型上,低维度到高维度的知识迁移效果更明显一些,说明模型规模也会影响迁移学习的效率。

在数据配方方面,研究团队发现,当训练数据中动态转换占25%、静态布局占75%时,模型的综合表现最佳。增加总体训练数据量,在同样比例下也能进一步提升成绩。

研究团队还尝试了强化学习(一种通过奖励和惩罚来训练模型的方法),并对比了两种奖励设计:一种是对错二分法的严格奖励,另一种是根据错误幅度给出渐进分数的宽松奖励。宽松奖励的效果略好,但整体来说强化学习带来的提升同样有限。

最关键的发现是:针对SPACENUM训练的模型,在其他外部空间推理基准测试上也取得了进步。测试覆盖了相机运动理解(OmniSpatial Motion)、动作后果预测(SAT Action Consequence)和物体运动推理(SAT Object Movement)三个任务。其中尤以物体运动推理的提升最为显著,8B规模的模型提升了43.5个百分点。这说明,针对空间数字理解的训练不是只会应付考试,而是在一定程度上真正改善了模型的空间认知能力。

**说到底,AI读懂数字背后的空间,还有很长的路**

归根结底,这项研究用一套严谨的测试揭示了当前视觉语言模型的一个根本性短板:它们生成的空间数字,很多时候只是"看起来合理"的输出,而不是真正扎根于对空间的理解。一个模型可以流畅地说出"椅子在坐标(2.2, 0.5)",但它可能根本不知道这意味着椅子在房间的哪个角落。

这对于在现实世界中应用AI来说,意义远不止于学术。当我们把视觉语言模型部署在机器人、无人机、智能家居系统中,期望它们能够准确执行"向右转30度"或者"走到沙发左边1米处"这样的指令时,如果模型对这些数字的空间含义是模糊的,那么后果可能是机器人撞上障碍物,或者无人机飞错方向。

好消息是,针对性的训练能够部分改善这一能力,而且这种改善具有一定的普遍性,不局限于训练用的特定场景。但坏消息是,提升效果仍然有限,现有模型与真正理解空间数字之间,还存在相当大的差距。

这也引出了一个值得思考的问题:要让AI真正理解空间中的数字,是需要更多、更好的训练数据,还是需要从根本上重新设计模型的结构和处理方式?模型内部在进行空间推理时究竟发生了什么,至今仍是一个黑箱——研究团队尝试通过分析注意力权重来窥探这个过程,但发现模型的注意力分布过于混乱,难以得出清晰结论。这也许正是下一阶段研究最需要突破的方向。

如果你对这个话题有进一步的兴趣,可以通过arXiv编号2605.23898找到这篇完整的论文,亲自深入了解这支研究团队的完整发现和方法细节。

---

Q&A

Q1:SPACENUM测试框架测的是什么能力,和普通的视觉问答测试有什么不同?

A:SPACENUM专门测试AI模型能否真正理解空间场景中数字的含义,而不只是看它能不能回答"图里有什么"。普通视觉问答测试往往考查物体识别、颜色判断等,而SPACENUM要求模型能把"旋转30度"对应到具体的视觉变化,或者把图片中的物体位置转换成坐标数字,考的是数字与空间现实之间的双向映射能力。

Q2:视觉语言模型在静态布局任务里表现比动态任务好,为什么还说静态任务表现也差?

A:静态布局任务中,模型在最简单的一维坐标和桌面场景里确实稍好一些,但研究发现模型主要靠的是语言知识来猜答案,而不是真正看图理解坐标。一旦场景升级到二维、三维或者房间尺度,成绩就跌回随机猜测水平。更重要的是,蒙眼测试显示遮住图片对模型影响不大,说明模型在这类任务中并没有真正利用视觉信息做空间推理。

Q3:针对SPACENUM做的训练对其他空间任务也有帮助吗?

A:有一定帮助。研究团队将训练后的模型放到OmniSpatial Motion、SAT Action Consequence和SAT Object Movement三个外部空间推理基准测试上,结果都有改善,其中物体运动推理任务的8B模型提升幅度达到43.5个百分点。这说明SPACENUM上的训练不只是"背题",而是在一定程度上提升了模型的通用空间理解能力,但距离完全解决问题仍有较大差距。

文章标签大模型机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多