Token导航 LogoToken导航

影眸 Hyper3D 发布世界生成模型 WorldGen

更新时间 2026-09-28来源 极客公园正文 6662字阅读约 21分钟14 张图片

本文首发于 Founder Park 公众号 · 2026 年 9 月 1 日

3D 生成的基本单位,正在从「物体」变成「场景」。

9 月 1 日,影眸 Hyper3D 发布世界生成模型 WorldGen。用户上传一张场景图片,两三分钟内,就能得到一个由多个独立物体组成的 3D 场景。

听上去,这只是把过去图生 3D 的生成范围扩展了一个层级。但在此之前,即使模型能把一张会议室照片转成完整的 3D 模型,桌椅、电脑和水杯也往往都和背景整体「黏」在一起,结果更像一件只能观看的「立体布景」。

而 WorldGen 会分别生成画面里的主要物体,再放回对应的位置。桌子、椅子和水杯各自独立,可以单独挑出来编辑或替换。它们也具备质量、摩擦系数等基础物理属性,能够在真实的物理引擎中被推动、拿起和交互。

这项能力源自影眸 Hyper3D 在 2025 年发表的 场景级生成研究 CAST。CAST 获得了国际图形学顶会 SIGGRAPH 2025 最佳论文,同期获此荣誉的商业公司,全球只有谷歌、Meta 和影眸 Hyper3D。此后,团队又用了一年多时间推进后续模型、算法与工程系统的演进,才把论文里的场景生成能力做成产品。

技术演示之外,WorldGen 已经开始进入真实生产流程。生成后的资产可以直接进入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等 DCC 与实时引擎环境,无缝衔接用户的既有工作流。不仅被很多创作者结合 Seedance2.5 等视频模型用于商业宣传片等影视制作,还被用于空间展示与 XR 内容创作。影眸 Hyper3D 也正与地瓜机器人、谋先飞合作,探索 WorldGen 在机器人仿真领域的应用。

在和 FounderPark 的对话中,影眸 Hyper3D 创始人兼 CEO 吴迪、联合创始人兼 CTO 张启煊进一步谈到了 WorldGen 的技术路线、商业化方向,以及 3D 生成接下来可能走向哪里。


Founder Park 正在持续寻找值得被看见的 AI 团队与项目。

我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。

如果你正在做 AI 相关的事,欢迎和我们聊聊。 
图片

01

从一张照片,

生成一个可交互的 3D 世界

在 Hyper3D 打开 WorldGen 的界面,第一步很简单,上传一张场景图片。它可以是任何一个真实空间的照片,比如一间办公室,也可以是一张想象中的开放世界概念图。

系统会自动识别图片里的主要物体,一键生成整个场景。用户也可以手动框选,指定哪些物体需要被生成。每选中一个物体,两三秒后就会出现一个初步的 3D 预览。一键完成包含十几个、二十个物体的场景,大约需要两三分钟。

但对于真正可用的场景级生成来说,把图片里的所有物体分别变成 3D,只是起点。场景级生成更难的部分,是让模型理解物体之间的物理关系。

一张图片里,桌上放着一瓶水。人可以凭常识判断,是桌子支撑水瓶,而不是水瓶托着桌子。但图片本身没有直接写出这种关系,也不会告诉模型水瓶的质量、摩擦系数、重心和碰撞体。遇到遮挡、透视畸变和信息缺失,模型还要补全看不见的几何结构。

WorldGen 会在后台建立物体关系图,识别接触、支撑、悬挂等关系,预测物体在同一空间里的位置、尺度和朝向,再进行基础的物理校正,减少穿模、悬浮和不合理堆叠。开启 SimReady 后,系统还会估计质量、摩擦系数、恢复系数和碰撞体等属性。由此得到的场景不只保留视觉外观,也具备进入游戏或机器人仿真的基础条件。

背后的技术可以追溯到影眸 Hyper3D 团队在 2025 年发表的研究 CAST(《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》),探索如何从单张图像出发,构造由多个独立、完整、可交互物体组成,且在物理关系上合理的 3D 场景。该项研究成果斩获当年国际图形学顶会 SIGGRAPH 最佳论文。

按照影眸 Hyper3D 团队的说法,这些物理属性更接近人看到一件物品时的直觉判断,属于「猜测的估计值」,暂时不能作为精密的工业测量结果,但已经足以支撑基础的物理仿真需求。比如两根柱子叠在一起,抽走下面一根,上面的柱子会随之倒塌。抽屉里的东西被打翻,会滚落到地面,而不是悬在空中。

现阶段,WorldGen 主要擅长生成刚体,搭出一个能继续运行和修改的空间骨架。生成的水龙头直接拧动,衣服自然褶皱这些关节化资产、柔性体和动态交互,会是技术路线图上的下一步。

为了兼顾可用性和视觉完整性,影眸 Hyper3D 选择 Mesh 与 3D Gaussian Splatting(高斯)的混合表达。

场景中需要移动、编辑和交互的主要物体,用 Mesh 生成。它有实体结构,可以附加物理属性,也更容易进入主流 3D 管线。天空、远景和不需要交互的背景,则由 3D Gaussian Splatting 补全,保留更多环境信息和沉浸感。

需要「用」的部分交给 Mesh,需要「看」的部分交给高斯。只用 Mesh,背景容易显得空。全部使用高斯,画面可以很完整,但物体缺少实体结构,很难用于物理仿真。

WorldGen 没有默认场景里的每件物体都以最高精度生成。基于 Hyper3D Rodin Gen-2.5 的 thinking effort 架构,模型最快可以用 4 秒生成一个资产,用户也可以根据自身需求花 40 秒或 80 秒补充更多表面细节。用户可以先用低时延模式看整体结构,再挑出关键物体继续 Refine。

这让场景生成不再是一次成本固定的「抽卡」。一个远处的花瓶和一个需要特写的主角道具,可以被分配不同的生成时间和精度。可控性不只意味着结果能不能改,也意味着用户可以决定时间和算力花在哪里。

很明显,当场景中的物体可以拆开、修改并进入后续工具,WorldGen 的目标,不仅仅是帮用户省下做几个 3D 模型的功夫,还有更大的目标。

02

WorldGen 想做的,

是内容生产的 3D 底座

一次生成十几个物体,最直接的价值当然是节省时间。但影眸 Hyper3D 认为,场景级生成带来的更大变化,并不只是让不同生成模型和生产工具多了一层连接,而是让 3D 场景成为整个内容生产流程的共同底座。

影视制作就是一个直观的例子。

今天的视频模型已经能生成质量极高的单个镜头,但在多镜头叙事中,一致性仍然是个难题。镜头切换后,飞船的结构可能发生变化,房间里的道具也可能出现在另一个位置。如果导演想把画面左侧盘子里的苹果移到右侧,纯视频生成很难稳定实现。而在 3D 场景中,这只是一次简单的移动操作。

WorldGen 提供的工作流,是先建立一个空间结构稳定、资产彼此独立的 3D 场景。创作者可以在其中调整镜头、构图、角色和道具,确定空间关系后,再把画面交给视频生成模型,补充人物表现、材质、光影和整体风格。

这更像一张「3D 导演台」。场景本身不必直接达到最终成片的视觉质量,但需要准确保存这个世界里有什么、物体放在哪里、镜头如何运动。3D 负责保存世界状态和提供控制,视频模型负责最终的视觉表现。

已经有创作者将 WorldGen 与 Seedance 2.5 结合,为一家新加坡音乐学院制作宣传片。先用 WorldGen 确定空间结构、镜头关系和可控白模,再由视频模型补充材质、光影与动态效果,最终成片被用于商业项目。

这套工作流也适用于传统扫描难以覆盖的场景。扫描的前提是现实中已经存在一个环境,并且完成了布景。科幻场景、概念空间等无法实拍的环境,则可以由 WorldGen 根据图片或创意描述直接生成。现实中存在的空间可以扫描,不存在的空间可以生成,两者都能先形成一个可控的 3D 基底,再接入后续的视频制作流程。

目前,WorldGen 已经与一些短剧和影视项目展开合作,相关作品仍在制作中。对多镜头叙事、广告、概念短片和影视预演而言,WorldGen 的价值在于先把容易变化的世界固定下来,再交给视频模型完成画面。

为了给影视制作带来更多创作可能性,WorldGen 配备 AI Render 模块,涵盖 AI 渲染和自由运镜等功能,让同一场景随心切换多元视觉风格,大幅提升产品概念演示、空间导览等影视内容的制作效率与视觉品质。

影视之外,同一套场景生成能力还可以进入游戏开发、XR 等领域。

过去,小的游戏团队搭建一个关卡,需要分别制作或购买资产,再由专业人员完成摆放、材质调整和性能优化。WorldGen 可以先把场景搭出来,其中的每个 Mesh 资产仍能独立导出,无缝接入 Blender、Unity、PlayCanvas、团结引擎、Unreal Engine 等主流工具进行后续的二次创作。

今年 7 月,影眸 Hyper3D 与 Unity 中国宣布合作,尝试打通 3D 生成与实时游戏应用之间的工程链路。对于小团队来说,这意味着不必先配置完整的美术工种,也能快速验证一个关卡或更复杂的世界设定。

随着 3D 生成进入游戏中,它还可能成为一种新的 UGC 机制。玩家可以在游戏中直接生成和修改 3D 内容,过去受限于预算、团队配置和资产商店的创意,也因此有了被实现的可能。

类似的场景还可以进入 XR 和空间计算。用户戴上 Apple Vision Pro 等设备后,可以进入由单张图片生成的三维空间,从不同位置观察场景,替换物体、调整陈列和修改布局。这套能力也可以延伸到室内设计、沉浸式教育和空间展示,让一张只能观看的参考图变成可以进入、编辑和交互的空间。

这些应用看起来相距甚远,底层诉求却相同。它们都需要一个可以拆解、编辑、运行,并且能够进入既有工具链的 3D 场景。3D 生成的竞争,也开始由「第一眼像不像」走向「生成一个物体之后还能做什么」。

03

具身训练场的多样性,

WorldGen 不设上限

如果说影视、游戏、XR 和空间计算需要的是一个可以控制、编辑和生产的空间内容。到了具身智能,对场景中物理准确度的要求又上了一个台阶。

具身仿真需要的场景不能只是看起来像真的,具身智能要在其中运动、抓取和碰撞,每个物体都需要有几何结构、碰撞体和基础物理属性。过去,一个仿真场景往往需要人工建模和搭建,制作周期长,也很难覆盖大量复杂布局和长尾物体。

作为 NVIDIA Inception 成员,影眸 Hyper3D 长期深度融入 NVIDIA 全球仿真生态。Hyper3D Rodin 此前借助 NVIDIA Omniverse 与 Isaac Lab 上线了 Sim-Ready 功能,让生成的 3D 资产自带物理属性,还推出了 Isaac Sim 官方插件。

Hyper3D WorldGen 则让这种协同走向纵深,过去是「一个资产进 Isaac Sim」,如今是「整个场景进 Isaac Sim」。从生成到仿真验证,影眸 Hyper3D 和 NVIDIA Isaac Sim 生态之间已形成完整通路,覆盖具身智能仿真数据的关键环节。

今年 7 月,影眸 Hyper3D 与地瓜机器人、谋先飞联合发布「具身智能可训练仿真闭环联合解决方案」。这套方案把 WorldGen 放在真实影像与机器人训练之间。

首先,WorldGen 从一张真实场景照片中识别并还原可交互的 3D 场景,并生成具备仿真导入能力的三维资产。用户还可以调整布局、替换物体,快速构造同一任务下的不同环境。

随后,谋先飞基于自研物理引擎 MotrixSim,将这些资产接入仿真环境,使机器人在其中运动、抓取和交互,获得物理与传感器反馈。同一场景可以复制多份并行运行,以支撑更大规模的训练。

地瓜机器人提供算力底座和开发工具链,把场景生成、仿真运行、数据采集、模型训练和策略验证连接起来。

在这套分工里,WorldGen 负责生成可用的场景资产,仿真引擎负责让它们运行,机器人平台则承接后续训练。

生成式 3D 还能补充真实数据难以覆盖的部分。现实中不可能购买 10 万种杯子逐一采集,也不适合让机器人进入火灾、抢险等危险现场反复训练。在仿真环境中,同一类物体可以扩展出大量几何和外观变体,极端环境也可以安全复现。

仿真数据的价值,一部分在规模,另一部分在现实无法提供的变化。但这不意味着仿真数据会完全取代真实数据,两者更可能长期混合使用,具体比例取决于任务和训练路线。影眸 Hyper3D 参与的研究 cuNRTO 获得了 2026 年 RSS 最佳论文提名,关注的也是生成资产、仿真训练与真实部署之间的 Sim-to-Real 问题。

04

对「世界模型」克制,

WorldGen 不追概念

Q:做完单物体生成后,为什么下一步是场景?

张启煊:做完单物体级 3D 生成大模型 Hyper3D Rodin 后,我们的技术路线向两个方向发展。

一个方向向内,一个完整资产能不能拆成具有结构关系的部件,对应我们在 Hyper3D Rodin Gen-2 中上线的 BANG 递归分件。另一个方向向外,一个资产能不能变成多个资产,共同构成一个空间,对应 CAST 和今天的 WorldGen。

场景生成对 3D 基座模型提出了更高要求。模型不仅要生成物体,还要理解物体之间的物理关系。比如盘子支撑着水果,水果和盘子又必须彼此独立。开启物理交互后,系统还要了解物体的质量、摩擦等属性。

吴迪:物体最终总要进入环境。它会成为游戏关卡中的素材、影视中的道具、机器人的仿真对象,或者室内设计中的空间元素。场景并不是为了追逐概念,而是单物体生成进入实际使用的必经环节。

Q:CAST 在 2025 年已经获得 SIGGRAPH 最佳论文,为什么还需要一年多才能做成产品?

张启煊:场景生成是一个多模块的复杂系统。假设每个模块的成功率都是 95%,五个模块串联起来,整体成功率就会明显下降。CAST 在框架上解决了大部分问题,但当时有冗余模块,独立模块之间的错误也会累积,一度无法产品化。这一年,我们做了很多工程和底层架构改造,减少模块、提高各个环节的稳定性,最后才认为它跨过了产品化门槛。

吴迪: 从论文到产品,并不是把代码包装上线。模型持续迭代了一年多,才让 CAST 描绘的方向具备稳定、可用的产品形态。

Q:你们把 WorldGen 叫「3D 世界生成模型」,它算「世界模型」吗?

张启煊:我们对世界生成模型的定义很直接,通过一段 Prompt 或一张图像,把其中描绘的场景还原出来。

传统 3D 生成关注单个物品,里面没有太多物理关系。场景里则存在复杂的物理关系。比如桌上放着一瓶水,为什么是水放在桌上,而不是桌子放在水上?模型要把这种底层逻辑还原出来,这也是 CAST 关心的问题。

我们内部最初争论最多的,是应该叫「场景生成」还是「世界生成」。最后选择 WorldGen,是因为它也能生成开放式场景,更接近一个世界。从广义上说,它可以成为真正的「世界模型」的重要组成部分。世界模型需要某种载体承载世界的外观和属性,我们选择的载体是 3D。

吴迪:我们没有把自己定义成「世界模型公司」。「世界模型」现在很难准确定义,我们是学术出身,对这个词有天然的敬畏,认为还需要更高阶的能力,才能被称为「世界模型」。

一类团队做的是 Action Model,也就是机器人大脑。另一类做环境和场景生成,下面又有 3D 路线和视频路线。大家都在从不同方向接近自己心目中的世界模型。最终由哪条路径实现,或者会不会由几条路线 Hybrid(混合),现在没有明确结论。

Q:具身智能会成为 WorldGen 最主要的应用方向吗?

张启煊:具身是重要应用方向,但不是唯一方向。现在 3D 资产的主要商业应用仍然在游戏、影视、3D 打印等领域。具身团队对可交互资产和仿真数据的需求确实在增长,我们现阶段更多提供基础资产与生成能力。

WorldGen 严格来说不是为具身行业专门开发的,它是一个通用产品。场景生成是游戏、XR、室内设计、视频生成和机器人仿真的共同诉求。我们不会因为发布 WorldGen,就把自己定义为具身智能公司,我们仍然是一家 3D 生成公司。

Q:WorldGen 接下来会优先押注哪个行业,游戏、影视、具身还是 XR?接下来的产品路线图是什么?

张启煊:我们的判断是,这些行业存在很大的共性,WorldGen 正是不同客户需求的交集。

场景生成一直是多个行业的客户都明确提出的共同需求,同时,我们对 3D 技术路径的判断也一直包含向内和向外两个方向。WorldGen 是沿着向外路线,目前能够触达的一个里程碑。

我们有多条产品线在并行推进。接下来会先补充动态能力,包括动画生成、自动绑定等工具链。现在 WorldGen 生成的场景已经具备碰撞关系,但还不能真正运动,下一步就是让这些资产和场景动起来。

再往后,我们需要一个 Agent System 或统一的调度层,把已经完成的生成、编辑、分件、场景和动画能力串联起来,降低专业工具的使用门槛。

长期来看,我们希望用户可以用一张图直接生成一个动态、遵循物理规律并且能够交互的场景。这件事可能不会特别远,基本都在我们的能力辐射范围内。

图片

图片
转载原创文章请添加微信:founderparker
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多