这项由延世大学与首尔大学联合完成的研究以预印本形式发布于2026年6月28日,论文编号为arXiv:2606.29513,感兴趣的读者可通过该编号查询完整论文。
当你走进一间客厅,你的大脑在零点几秒内就完成了一件了不起的事情:你不仅看到了"这个空间",还立刻识别出了"沙发在哪里"、"桌子在哪里"、"椅子在哪里"。你的认知系统天然地将这个空间分解成一件件独立的物体,而不是把它当成一团连续的颜色和光线。然而,当今主流的3D场景重建技术,却恰恰在这一点上与人类大脑背道而驰——它们把整个场景揉成一堆密密麻麻的"点"或者"气泡",根本不知道哪些点属于沙发,哪些点属于桌子。这篇研究的出发点,就是要扭转这个局面。
研究团队把这个问题的本质归结为一种"表示不匹配":不是机器缺乏足够聪明的特征,而是它用来表示场景的基本单位根本就不是"物体",而是细碎的几何片段。就算你在每个碎片上贴了标签,贴完之后你还是得重新做一遍"把碎片拼回物体"的工作。这就好比一个积木盒子被倒在地上,你给每块积木涂上了颜色,但想知道哪些积木拼成了一栋房子,哪些拼成了一辆车,你还得一块一块地重新拼。研究团队想做的,是让机器一开始就以"物体"为单位来理解场景,而不是先堆一堆碎积木,再慢慢拼回去。
一、旧方法的根本困境:堆积木容易,认积木难
要理解这项研究的价值,得先搞清楚现有方法到底有什么问题。
目前最流行的3D场景表示方式叫做"3D高斯溅射"——你可以把它理解为用无数个半透明的小气泡来填充空间,每个气泡记录一小块区域的颜色、透明度和形状信息。把这些气泡渲染出来,就能得到逼真的3D场景图像。这种方式在视觉效果上非常出色,但它天然缺乏"物体意识"——每个气泡只知道自己这一小块区域长什么样,完全不知道自己属于沙发还是地板。
近年来,研究者们尝试给每个气泡贴上"语义标签",比如从大型2D视觉模型那里借来特征向量,附加到每个气泡上。这个思路有一定效果,但问题依然存在:同一件沙发上的每个气泡都各自存了一份"我是沙发"的信息,信息被重复存储了成千上万次,极度浪费;更重要的是,如果你想对沙发做任何操作,比如把它移走或者替换成另一张椅子,你得先把分散在几万个气泡里的"沙发信息"全部找出来并重新组合,这个过程繁琐且容易出错。
更根本的问题在于:一个气泡永远只是局部几何的碎片,无论你在上面贴什么标签,它都没有能力理解"我是沙发整体的一部分"这件事。物体层面的上下文信息根本无法从碎片中自然涌现出来,只能依靠后续复杂的后处理步骤来勉强重建。
二、新框架的核心思路:先认物体,再记细节
研究团队提出的解决方案叫做"实例结构化3D词元组"(Instance-Structured 3D Token Groups)。这个名字听起来复杂,但背后的思路用日常语言来说相当直接:给每件物体分配一个"身份证",再给这件物体的每个局部区域分配一个"详细档案",两者合在一起就是这件物体的完整表示。
具体来说,系统会为场景中识别出的每件物体生成一个"群组词元"(Group Token),这就是那张"身份证",它记录了这件物体是什么、大概在哪里、有多大。与此同时,每件物体还拥有一组"锚点词元"(Anchor Tokens),这些锚点就像是"详细档案"里的各个条目,每个锚点负责记录物体某个局部区域的几何形状和外观细节,并进一步生成那个区域的3D高斯气泡用于渲染。
这种两层结构的关键在于分工明确:群组词元管"这是什么物体、它作为一个整体的身份",锚点词元管"这件物体的这个局部区域长什么样"。两者相互配合,既保留了足够的细节来渲染高质量图像,又从一开始就以物体为单位组织信息,无需任何后处理来重建物体边界。
更值得注意的是,整个过程只需要给机器看几张没有相机位置信息的普通照片(称为"无姿态图像")——不需要事先告诉机器相机在哪里拍的,机器自己会在一次前向推断中完成整个场景的分解和重建。
三、机器怎么学会认物体:一场"拼图游戏"的训练
研究团队面临的一个核心挑战是:你怎么教机器以物体为单位理解场景?
他们的方案是让机器同时完成两件事,并用两种不同的"评分标准"来督促它:一方面,机器渲染出来的图像要尽可能接近真实照片,这用来保证几何和外观的准确性;另一方面,机器划定的"这是一件物体"的边界要尽可能匹配真实的物体分割图,这用来保证物体识别的准确性。两个目标同时优化,让机器在学会把场景画得像的同时,也学会把场景拆得对。
训练过程中有一个技术细节相当关键:锚点怎么知道自己该归属于哪件物体?系统通过一种叫做"softmax竞争"的机制来解决这个问题。每个锚点词元和所有群组词元分别计算"相似度分数",然后通过一个归一化操作,让每个锚点最终归属于与它最相似的那个群组词元。这就像是一次投票:每个锚点把票投给它最认同的那个"物体身份证",票数归一化后形成一个清晰的归属关系。这个机制促使不同群组词元之间相互竞争,争夺对锚点的所有权,最终形成清晰的物体边界。
此外,研究团队还注意到一个实践中的细节:如果一开始就用很强的物体分割损失来督促机器,会因为几何还没学好而产生混乱的训练信号,反而让两个目标互相干扰。为此,他们设计了一个"热身期"机制:训练最初的一段时间(约1500步),物体分割的监督信号逐渐从零增大到正常水平,等到几何重建基本稳定后,物体分割的监督才全面介入。实验证明这个设计非常有效——没有热身期时,分割性能甚至还不如先分别训练两个目标再合并的方案。
还有一个额外设计:锚点归属时还引入了一个"空白通道",专门接收那些不属于任何有意义物体区域(比如边缘噪声或背景混乱区域)的锚点,这让系统能更干净地处理场景中非物体的部分。
四、存储语义的聪明方法:一张"摘要"加若干"注解"
当系统学会了以物体为单位组织场景之后,研究团队进一步利用这种结构来高效存储语义信息(也就是"这是什么东西"这类知识)。
传统方法是给每个气泡都存一个高维度的特征向量,比如512维,这就像给每片积木都印一本512页的说明书,不仅占用海量存储空间,而且同一件物体的几万个气泡上都存着几乎一样的说明书,浪费极度严重。
研究团队的方案是:每件物体只存一个"群组级语义特征",这是一个512维的向量,相当于这件物体的语义摘要;此外,每个锚点存一个极低维度(仅8维)的"残差",记录这个局部区域与整体摘要之间的细微差异。渲染时,像素的完整语义特征由"物体摘要"加上"局部残差"合成得到。
这个分解设计有多高效?与其他方法相比,存储的语义信息量从840万个数值(Uni3R方法,每个气泡64维特征)压缩到了5.94万个数值,缩减了超过140倍,而语义检索精度(mIoU指标)反而从0.558提升到了0.657,提升幅度相当可观。这背后的逻辑是:同一件物体内部的语义变化本来就不大,一个锚点词元内的区域在语义上高度相似,真正需要细分的只是极少量的局部差异,8维残差已经完全足够捕捉这些差异了。
五、系统从头到尾怎么运转:一次完整的场景理解之旅
从几张普通照片到一个结构化的3D场景,整个过程分为几个连贯的阶段。
首先,系统把输入的多张照片送入一个预训练好的"几何基础模型"(具体是VGGT模型),这个模型会从照片中提取每个位置的几何特征,并生成一张"点图"——你可以把它理解为把照片里每个像素的位置估计到3D空间中,形成一张密集的3D坐标图。然后,系统把从多张照片中提取的特征和坐标信息合并,形成一个统一的"上下文特征集合",为后续的词元生成提供原料。
接着,系统从这片3D坐标云中用"最远点采样"的方式选出1024个代表性位置,每个位置对应一个锚点词元的初始位置,初始状态由该位置的上下文特征加上3D坐标的编码合成。与此同时,100个"群组词元"作为可学习的嵌入向量被随机初始化,准备通过训练来代表场景中的100个潜在物体实例。
随后,两个变换器模块接续工作。第一个是"图像-锚点变换器",它让锚点词元通过交叉注意力机制从整个上下文特征集合中汲取信息,使每个锚点既了解自己附近的几何细节,也能感知更大范围的场景信息。第二个是"锚点-群组变换器",它让群组词元通过交叉注意力机制从所有锚点词元中聚合信息,使每个群组词元能够整合它所代表的那件物体的整体特征。
最后,每个锚点词元通过一个小型神经网络生成32个3D高斯气泡,每个气泡的位置、大小、旋转、不透明度和颜色(用球谐函数表示)都由这个网络预测。每个气泡从它的父锚点那里继承归属概率,因此整个3D场景自然地被分割成最多100个物体实例的集合,每个实例都有专属的气泡群。
六、实验结果:全面超越或媲美同类方法
研究团队在ScanNet室内场景数据集上进行了全面评测,覆盖三个核心任务。
在开放词汇语义特征提取任务上,系统以相当大的优势领先于所有对比方法。具体来说,在目标视角下的语义分割精度(mIoU)上,该方法达到0.657,而最接近的对比方法C3G仅为0.513,Uni3R为0.558,LSM为0.512。这个优势直接来源于实例级语义存储的设计——物体级摘要天然地保证了同一物体内部语义的一致性,这是逐气泡存储特征的方法所不具备的内在优势。
在新视角重建质量上,系统表现出了良好的竞争力,但并未在所有指标上全面领先。Uni3R在PSNR和SSIM上略高于该方法(分别为25.53对25.28,0.873对0.771),这个差距来源于架构上的设计取舍:该方法使用了紧凑的1024个锚点词元,每个词元生成32个气泡,总共约3.3万个气泡,而Uni3R和LSM各自使用了13.1万个像素对齐的高斯气泡,密度高出约4倍。然而,一个值得关注的现象是,在将ScanNet训练的模型直接迁移到MipNeRF360户外场景(零样本测试,完全不做微调)时,该方法的PSNR达到16.52,而Uni3R仅为14.58,在SSIM和LPIPS上同样更优。这表明锚点-群组结构学到的是更具泛化能力的场景先验,而不是过度拟合于训练数据的分布。
在类无关实例分割任务上(使用8张上下文图像),该方法取得了最为显著的领先。AP指标上,该方法达到0.235,而需要对每个场景单独优化的Gaussian Grouping仅为0.139,ObjectGS为0.178,甚至先做前向推断再做后处理优化的IGGT+LUDVIG也仅为0.122。一个全前向推断的模型在实例分割上超越所有需要逐场景优化的方法,这个结果颇具说服力:当物体实例是表示的原生结构单元时,分割质量有着天然的保障,不需要后期费力地从零碎的几何基元中重建物体边界。
七、把物体当作操作界面:三种直接可用的应用能力
实例结构化词元组的价值不仅体现在评测指标上,更体现在它直接开放出来的操作能力上。
场景编辑能力是最直观的体现。因为每件物体对应一组独立的词元和气泡,想移走一件物体只需要把对应的词元组删除,剩余场景完全不受影响;想移动一件物体只需要对它的锚点坐标和气泡位置做一个刚体变换;想从另一个场景里插入一件物体,只需要把那个场景里对应的词元组"搬运"过来。整个过程不需要任何手动标注、后处理流程或场景特定的优化,所有操作都直接作用于一次前向推断产出的词元组。对比之下,传统的基于气泡的方法要实现同等的编辑效果,要么需要在优化阶段就加入特殊的身份监督(Gaussian Grouping,ObjectGS),要么需要把2D预测提升和合并到3D中(IGGT),流程繁琐且容易引入误差。
开放词汇3D实例检索是另一个直接受益于实例结构的能力。每个词元组存有一个群组级语义嵌入,文本查询或图像查询可以直接与这些嵌入做相似度匹配,找出最匹配的物体实例。由于检索是在物体层面(最多100个实例)进行,而不是在气泡层面(数万个气泡)进行,检索的复杂度与场景中的物体数量成正比,而非与几何基元数量成正比,效率提升极为显著。检索结果是一个完整的、空间连贯的物体实例,而不是散落在各处的气泡子集,这个性质直接来源于表示的实例结构,无需任何聚合后处理。
在RealEstate10K数据集上的实验进一步展示了系统的泛化能力:该数据集没有任何人工标注的实例分割标签,研究团队用SAM2自动生成的伪标签作为监督信号来训练系统,结果在重建质量上依然优于对比方法C3G,预测的实例分割图也保持了合理的连贯性,即便伪标签本身有时会把同一件物体拆分成多个ID,系统依然能学出相对一致的物体边界。这说明词元组结构对监督噪声有一定的容忍性,不依赖高质量的标注数据才能工作。
八、几个关键设计选择的消融验证
研究团队用消融实验验证了几个关键设计选择的必要性。
关于联合训练,他们对比了三种方案:同时优化重建损失和分割损失的联合训练(最终方案)、先单独训练重建再单独训练分割的顺序训练、以及联合训练但不使用热身期的方案。顺序训练导致分割AP从0.193大幅下降到0.032,这说明重建和分割两个目标必须共同训练才能让词元组结构真正涌现——重建目标会引导锚点词元学到与物体边界相容的几何表示,而分割目标则直接塑造群组词元的边界感知,两者相互强化。没有热身期的方案比顺序训练还要差(AP仅0.081),因为在几何尚未稳定的早期就引入强分割损失,会产生互相冲突的梯度,把两个目标都破坏掉。
关于分解特征提取,他们对比了只用锚点残差、只用群组级嵌入、两者结合三种方案。只用锚点残差效果最差(mIoU 0.524),因为8维残差的容量根本不足以单独表示完整的语义信息,没有群组摘要来承担主要语义负担时,残差只能苦苦硬撑。只用群组级嵌入已经相当不错(mIoU 0.635),这说明同一物体内部的语义变化确实相当小,一个512维的共享摘要能捕捉绝大部分语义信息。加入锚点残差后进一步提升到0.657,说明物体内部确实存在一些值得精细刻画的局部语义差异,两层设计各有其不可替代的贡献。
九、这项研究的局限与未来方向
研究团队坦率地指出了当前框架的几个局限,也描述了他们设想的未来延伸方向。
在当前局限方面,评测主要集中在有界的室内场景,扩展到室外环境或大规模城市场景还未经验证,100个群组词元的上限在更复杂的场景中可能成为瓶颈。单个群组词元对复杂或高度多样化物体的语义表达能力也可能有限,未来可以考虑每个群组使用多个语义基向量。此外,当前框架假设场景是静止的,无法处理物体运动的情况,这限制了它在机器人等需要处理动态环境的应用中的直接使用。
在未来方向方面,研究团队提出了两个颇有想象力的延伸路径。其一是与大型语言模型的结合:一个场景被压缩为不超过100个词元组,这恰好是大模型能够高效处理的规模,可以直接对物体级词元做语言推理,需要细节时再查询锚点层,这为"语言指导的3D场景理解和操作"提供了一条清晰的路径。其二是作为机器人的感知前端:给机器人几张场景照片,系统在一次前向推断中产出所有物体的实例句柄,机器人可以用语义嵌入将语言指令(比如"把那本书拿过来")定位到具体的词元组,再用词元组的操作接口来规划和模拟物理操作,而操作的计算复杂度只与物体数量相关,而非与几何基元数量相关,时效性远优于传统方法。
说到底,这项研究做的事情可以用一句话概括:它让机器在理解3D场景时,从"看到一堆点"变成了"看到一件件物体",而且这种理解是在场景重建的第一步就完成的,而不是作为后处理的附加产物。这个改变看似只是表示方式的调整,实际上开启了一系列原本需要复杂后处理才能实现的功能,从场景编辑到语义检索,全部变得直接而自然。
对于普通人来说,这意味着未来的AR眼镜、家用机器人或者智能家居系统,能够以更接近人类直觉的方式理解它们看到的空间——不是"这里有一片橙色的像素区域",而是"这里有一张沙发"。有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.29513查阅原论文。
Q&A
Q1:实例结构化3D词元组和传统3D高斯溅射的根本区别是什么?
A:传统3D高斯溅射把场景表示为数万个独立的几何"气泡",没有任何物体边界概念,想知道哪些气泡属于同一件物体还需要额外处理。实例结构化3D词元组直接以物体为单位组织表示,每件物体有专属的"身份词元"和一组"细节词元",物体边界是表示的原生结构,无需后处理重建。
Q2:这套系统需要人工标注3D物体信息来训练吗?
A:不需要任何3D标注。系统完全通过2D图像监督来学习:RGB图像监督几何重建质量,2D实例分割图(可以是人工标注也可以是SAM2自动生成的伪标签)监督物体边界。3D层面的实例结构自然地从2D监督中涌现,不依赖昂贵的3D标注数据。
Q3:实例结构化3D词元组的语义检索为什么比传统方法高效?
A:传统方法把语义特征存在每个气泡上,检索时需要遍历数万个气泡并聚合结果。实例结构化词元组只在物体层面存储一个共享语义摘要,检索时直接在最多100个物体嵌入上做匹配,复杂度与物体数量而非气泡数量相关,效率差异可达数百倍,且检索结果天然是完整连贯的物体实例。







