IT时报记者 贾天荣
如果说过去的人工智能是在数字世界里“回答问题”,那么下一阶段的AI,则需要进入真实世界,理解物体、空间和物理规律。
近日,国内物理AI基础设施企业飞捷科思向全球开发者开源Fysiverse-3D三维世界构建技术体系、OmniFysics物理感知系列模型、FysicsReason可验证评测基准等核心技术。
《IT时报》记者从飞捷科思获悉,此次开源覆盖物理AI发展的“构建、感知、评测”三个关键环节,试图打通从现实世界理解到虚拟环境生成,再到智能体训练验证的完整技术链路。
业内认为,对于机器人、数字孪生、智能制造等领域而言,物理AI的核心挑战并不是让AI“看见”世界,而是让AI真正理解世界,并在虚拟环境中学习如何与现实世界交互。
AI构建三维环境在物理AI体系中,首先需要解决的问题是:如何让AI生成一个符合现实规律的世界。此次开源的Fysiverse-3D,是飞捷科思Fysiverse物理世界模型体系中面向三维世界构建的核心技术体系,覆盖从自然语言描述到可执行三维世界生成的完整流程。

简单来说,用户输入一句话,系统可以生成一张符合空间关系的图像,并进一步将其转化为能够运行在物理引擎中的三维环境。
这一过程并不是简单的“生成图片”。飞捷科思介绍,Fysiverse-3D首先通过可验证空间文生图方案SpatialGuard,对自然语言中的空间意图进行规划,将文字中的物体位置、相互关系等信息转化为可检查的空间约束,再生成空间关系准确的视觉观测。
例如,一句话描述“桌子旁边放着一把椅子,桌面上有一个杯子”,AI不仅需要生成桌子、椅子和杯子,还需要保证三者的位置关系符合描述。
传统图像生成模型往往更关注画面是否逼真,但对于机器人训练而言,“看起来像”远远不够。如果物体位置错误,后续的三维重建和物理模拟都会受到影响。
SpatialGuard通过“规划—渲染—验证—修复”的闭环方式,让空间关系在生成过程中保持可验证状态。据介绍,该技术相关成果已被自然语言处理领域顶级会议EMNLP以长文形式录用。
三维场景从“能看”走向“能交互”生成图像之后,如何让AI真正理解其中的物体和空间关系,是三维世界构建的第二步。飞捷科思开源的Fysiverse-3D-Vision(F3V),进一步解决了从二维图像到对象级三维场景重建的问题。
过去的三维生成技术,往往关注单个物体是否逼真。但真实世界中的机器人,需要面对的是复杂场景。
Fysiverse-3D-Vision将三维生成从单个资产扩展到场景级空间组织。据介绍,该系统会分别处理“生成什么物体”和“物体放在哪里”两个问题:一方面恢复物体外观和几何结构,另一方面根据场景图像预测物体的位置、旋转和尺度,再将不同对象放回统一空间。
这样生成的三维世界,不只是一个视觉模型,而是包含独立对象、空间关系和功能信息的结构化环境。
对于场景编辑而言,独立对象意味着用户可以单独调整某个物体;对于机器人训练而言,这些信息则可以作为后续操作和交互的基础。
飞捷科思表示,Fysiverse-3D-Vision希望推动三维内容从“能够展示”进一步走向“能够编辑、交互和仿真”。目前,该项目代码已同步开源。
让虚拟世界“站得稳、跑得起来”对于具身智能而言,一个三维场景真正有价值的标准,不只是像不像,而是能不能运行。
机器人训练需要大量仿真环境,而传统方式通常依赖多视角扫描、人工建模、手工摆放和碰撞调试,成本较高,也难以快速生成大量不同场景。
针对这一问题,飞捷科思开源Fysiverse-3D-SimReady(F3SR),进一步将三维重建结果转化为仿真就绪环境。F3SR在Fysiverse-3D-Vision输出基础上,完成场景级“接地精修”,让生成的物体符合重力、碰撞等物理规律。
简单来说,就是让虚拟世界里的物体不仅“摆在那里”,还能像真实世界一样受到物理规则约束。例如,一个杯子放在桌面上,系统需要判断它是否真正接触桌面,是否会因为重力滑落,是否存在与其他物体穿透的问题。
飞捷科思表示,Fysiverse-3D-SimReady通过“重力一致初始化、输入视角对齐、场景图引导接触修正、智能体目标条件仿真”四个步骤,实现从视觉场景到物理环境的转换。
在相关测试中,该技术在视觉一致性和物理稳定性之间进行了平衡。
物理AI竞争进入基础设施阶段除了三维世界构建,飞捷科思此次还同步开源OmniFysics物理感知系列模型和FysicsReason评测基准。
OmniFysics旨在提升AI对物理规律的理解能力,通过视频、图像、声音和文本信息,分析物体运动、接触关系、材料属性等信息,并估算质量、摩擦、弹性等物理参数。
FysicsReason针对当前多模态模型评测中“只看答案、不看过程”的问题,引入“世界状态变量”概念,将模型能力拆解为世界感知和推理两个阶段,帮助研究者判断模型究竟是“没有看懂”,还是“理解错误”。
进入物理世界后,AI需要面对更加复杂的问题:如何理解空间,如何模拟规律,如何在虚拟环境中学习,并最终作用于现实。
随着机器人、智能制造、数字孪生等产业加速发展,物理AI正在成为连接数字智能和现实世界的重要基础设施。此次开源,也意味着更多开发者可以参与到物理世界模型的探索中。未来,物理AI能否真正走向规模化应用,还需要技术、生态和产业场景的进一步融合。







