Token导航 LogoToken导航

影溯科技发布新一代世界模型 推进空间智能产业落地

更新时间 2026-09-30来源 甲子光年正文 4157字阅读约 13分钟4 张图片
图片

世界模型从Demo走向产业的关键一步,或许就在这里。

作者|麦子

编辑|栗子

9月28日,AMD宣布将以约82亿美元收购李飞飞创立的World Labs。

对于空间智能行业来说,这笔交易释放了一个很明确的信号。世界模型正在从前沿研究走进芯片和AI基础设施公司的战略版图,这说明空间智能的落地应用也可能大幅提速。

而就在三天前,国内空间智能公司影溯科技在上海国际视听艺术嘉年华发布并上线了新一代世界模型 InSpatio-World 1.5,进一步开拓应用边界。

这一次,影溯科技发布的InSpatio-World 1.5支持单图、多图、全景图和视频等不同输入,并继续强化实时场景探索和时空一致性。这意味着,一张照片、一组图片甚至一段已有视频,都可以成为用户进入一个空间的起点。

对于影视和内容创作,它可以变成一个拍摄完成后仍能继续寻找机位的“虚拟摄影机”;对于沉浸式体验和具身智能,模型则进一步承担空间视角推理和动态环境建模的任务。目前,影溯也已经开放1.5试用并开源代码,并即将邀测Topos-Pro 1.0,希望开发者和创作者将这些能力进一步应用于实际场景。

如果说AMD收购World Labs说明空间智能开始被芯片和基础设施厂商提前布局,那么影溯这次1.5的发布,更像是另一个信号。国内的世界模型也开始从展示“能生成什么”,往“这些能力能不能真正被用起来”推进。

1.从单张图片到动态世界,

InSpatio-World 1.5开始构建“持续空间”

图片


刚刚过去的2026国际视听艺术嘉年华,是由央视上海总站与上海市政府相关方面协同打造的盛会。现场集中展示了不少国内科创企业在影像、AI和数字内容上的最新成果。其中一段由AI生成的视频,让人感受到了如今AI技术的跨越式进步。

画面一开始从一座中式宫殿的廊下向前推进,镜头向前推进,红色立柱从画面两侧掠过;随后,镜头越过栏杆和台阶,逐渐转向庭院。原本藏在柱子之后的建筑一点点出现,亭台、宫殿也随着机位变化进入画面。

这段视频是用影溯最新发布的InSpatio-World 1.5生成的。视频中的镜头不断离开原始视角,绕过遮挡,进入原本看不到的区域。不论角度如何变化,视频中的建筑、庭院和远景依然尽量维持原来的空间关系,材质、光线和风格也没有明显跳变。

影溯把这种能力称为实时场景漫游。InSpatio-World 1.5仅仅从一张图片出发,通过流畅的镜头运动保持连贯的空间结构,使不同视角下生成的画面保持空间一致性。

静态场景之外,1.5还向动态世界做了进一步探索。比如,输入一张桌子上放着橘子的图片,并让它生成一颗橘子正在桌面上滚动的视频。

如果镜头始终固定,生成这样的视频并不是难事。可在 InSpatio-World 1.5 生成的画面里,摄影机还能绕到橘子的另一侧,离开原来的拍摄轨迹,从新的位置继续观察橘子滚动并掉进筐中的全过程。

这就要求,模型既要知道橘子已经滚到了哪里,也要判断换一个机位之后,眼前应该出现什么场景。这背后蕴含着模型对空间和时间的深度理解。

可以看到,通过从大量动态真实世界数据中学习,InSpatio-World 1.5 具备动态场景中的下一视图预测能力,能够预测新观察视角下的画面,也能继续推理场景随时间发生的变化,让同一个动态世界在不同位置、不同时间点上保持连贯。

这种能力往前延伸,也有更直接的应用价值。对于影视创作,它可以支持更自由的镜头设计。对于空间智能,它可以帮助模型推理不同视角下的场景变化。在具身智能领域,它又可以用于理解和建模持续变化的真实环境。

此外,InSpatio-World 1.5还有一个很实用的变化。它可以接受单张图像、图像集、全景图或视频,从而能够从各种来源材料中进行空间探索。同时,1.5还支持录制、回放和下载的功能,更方便用户体验和使用。

比如广告中最常见的子弹时间创作。传统拍摄里,需要先用多台摄影机在同一时刻记录主体的不同角度。到了 InSpatio-World 1.5,这些同步拍下的多张图片可以直接作为输入,再围绕主体设计新的摄影机路径,生成一段连续的环绕镜头。

更重要的是,InSpatio-World 1.5即便采用多种输入类型,也依旧能够保持时空一致性。哪怕是摄像机的剧烈移动和时间的推移,InSpatio-World 1.5依旧能够保持主体身份、空间结构和场景细节。

把这些变化放在一起看,InSpatio-World 1.5真正推进的,是让AI生成的画面开始具备更稳定、更连续的空间关系。

当镜头可以走得更远,时间可以继续往前,不同输入也能被放进同一个模型里,世界模型的竞争标准就开始发生变化。接下来真正拉开差距的,是谁能把一个生成出来的世界持续维持下去,让它经得起视角变化、时间推进和真实交互。

2.世界模型走向具身智能,

先要解决机器人的“视角问题”

图片


世界模型这两年越来越热,创作出的视频也越来越精美。但大家关心的是,它什么时候能被真正用起来,尤其是机器人如何更好地使用世界模型。

机器人进入现实世界之后,面对的环境一直在变化。它要知道自己在哪里,物体在哪里,往前走一步以后会看到什么。一个人从面前经过,原本被挡住的东西还在不在。机械臂伸出去以后,周围的空间关系又会怎么变化。

这些问题,都和对空间的持续理解有关。

可以看到,李飞飞创办的 World Labs 已经开始把 Atlas 用到机器人相关场景里。它尝试从真实环境出发,生成可以继续探索和模拟的空间,用来帮助机器人理解不同视角和环境变化。

而面对这一问题,影溯的思路一直更注重实际落地。

针对机器人训练素材不足、跨场景泛化能力受限的问题,影溯首先抓住的是“新视点预测”,尝试把互联网中的2D数据转化为3D训练素材,同时在统一三维空间中研究状态与动作变化,为机器人的预测和规划提供支持。

如果模型能够从当前画面出发,判断换一个位置之后会看到什么,就意味着它开始理解相机位置、物体关系和空间结构。对机器人来说,这种能力可以帮助机器人建立对“看不见部分”的判断。

比如机械臂伸向桌面上的杯子,手臂可能会挡住目标。如果模型能够维持前后的空间关系,它就可以知道,杯子虽然暂时看不见,依然还在原来的位置附近。这就是空间理解和普通图像识别之间很大的差别。

更现实的问题来自数据。今天互联网上已经有大量关于人类如何拿东西、开门、整理桌面、使用工具的视频,但这些素材大多从第三视角拍摄。机器人真正执行任务时,看到的却往往是第一视角。两者之间存在明显的数据错位。

InSpatio-World 1.5 尝试通过跨视角生成去弥合这层差异。模型可以基于外部拍摄的第三人称视角视频,预测并生成更接近机器人自身视觉的第一人称视角(ego)视频。同一段操作过程,也可以从不同方向重新观察,并改变原有的遮挡关系。

这样一来,一段真实操作视频就不再只有一个固定机位。它可以从左侧看,也可以从右侧看,还可以从更接近机器人实际执行任务的位置重新观察。同一个动作过程,由此能够扩展出更多视角下的训练素材和回放记录。

这对具身智能很有价值。不同视角、遮挡和空间变化可以被重新生成,一次真实采集也能扩展出更多训练数据。

影溯之所以更关注这些产业痛点,也和团队积累有关。创始人章国锋长期从事3D视觉和空间智能方面的研究,核心团队主要来自浙江大学CAD&CG全国重点实验室和商汤三维视觉与混合现实团队。团队过去在SLAM、三维重建和AR/MR方面的经验,也使其在今天的模型研究工作中更加重视镜头控制、空间一致性和实时交互。这些积累,也让影溯更有条件把世界模型继续往产业里推。

图片

云栖大会:影溯科技创始人章国锋现场为观众讲解


接下来,空间智能和世界模型领域真正要验证的,就是能不能进入机器人训练、空间计算和内容生产的真实工作流。


毕竟,当世界模型开始成为机器人理解环境、补充数据和进行预测的一部分,它才真正从一项生成能力,走向空间智能的基础工具。

3.世界模型的下一场竞争,

是谁先接进真实工作流


一个越来越明显的变化是,世界模型的竞争重心,正在从能力展示转向产业落地。

AMD最近宣布以约82亿美元收购World Labs,就是一个很有代表性的信号。World Labs做的是空间智能和世界模型,AMD提供的则是GPU、软件栈和底层计算平台。这笔交易表明,空间智能接下来的竞争会越来越靠近真实落地场景。

世界模型真正进入真实工作流和产业,最先发生的变化,可能就在创作者手里的那台“摄影机”。

影溯也同样意识到这一点。InSpatio-World 1.5已经展示出更自由的镜头使用方式。用户可以基于已有的单张图片、图像集或视频,继续尝试新的机位和运镜方式,并探索场景。

更关键的是,这些不同类型的输入被统一进了同一套模型。InSpatio-World 1.5继续扩展时间自回归架构,把单图、多图、全景图和视频统一编排成Token,并将空间、时间和观察视角等信息压缩进时空Cache和渲染条件中。

这意味着,现有素材可以直接进入同一套框架继续生成和探索,也降低了模型接入影视、广告、数字内容和机器人训练工作流的门槛。

因此,相比单一输入模型,InSpatio-World 1.5已经更接近一种可以直接嵌入真实应用的空间生成能力。

当然,从演示能力走到成熟工作流,中间还有不少问题需要验证。创作者真正关心的会是镜头能不能稳定控制,连续生成是否足够一致,以及它能不能接进现有的影视和广告制作流程。相比单纯生成一个漂亮的Demo,这些因素对产品能否被长期使用更为关键。

于是,影溯也在继续往3D空间本身推进。近期开始邀测的世界模拟器Topos-Pro 1.0,能够把场景中的物体进一步转成可以编辑、交互和仿真的3D资产。这一步对具身智能尤其关键。过去搭建机器人训练环境,需要采集、扫描、建模,再配置碰撞和物理属性,流程长、成本高。生成式3D技术有望简化其中部分环节,让真实图片和视频更快进入仿真系统。

走到这里,世界模型的应用也开始从单一的能力展示,延伸至3D重建、内容制作和机器人仿真等环节,并与底层算力平台进一步结合。

产业接下来真正要验证的,也会越来越具体。现在,影溯正在努力尝试把一个“可以观看和探索的世界”,继续变成一个可以编辑、交互,最终被产业真正使用的空间。

世界模型从Demo走向产业的关键一步,或许就在这里。

(封面图来源:影溯科技)

文章标签机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多