Token导航 LogoToken导航

卓驭科技发布闭环世界模型ZYT World

更新时间 2026-09-24来源 Vehicle正文 2119字阅读约 7分钟3 张图片
最近,国内领先的移动物理AI公司卓驭科技发布了旗下闭环世界模型 ZYT World。特点是AI在模型中的任何决策都会给出真实的回应。就像是给AI控制的方向盘插上电,AI打左世界往左,并且把新画面再喂回AI。
要做到这点,需要同时解决4个行业长期难以兼顾的难题:
  1. 真实:让AI看到的与量产车相机中看到的画面一致
  2. 可控交互:AI变个方向环境能立刻响应,还能支持加戏改剧本
  3. 响应快:百毫秒级决策一次
  4. 记得住:AI绕回同一路口,真实环境又能重现回来
图片
而ZTY World已经成为卓驭迈向移动物理AI迭代进化的关键利器,卓驭的表述是:
  • 往下,给卓驭量产的原生多模态基础模型做强化学习和仿真评测,为每次模型发版贡献超20万场景闭环用例;
  • 往上,作为原生多模态基础模型的实时训练场,让模型在支持多模态的平行世界里学会因果理解和反事实推理;
  • 往外,特有的相机控制能力把已有数据拓展到商用重卡、物流车等多种构型平台。

让世界有“记忆”,让AI懂“因果”
世界模型本身并不新奇,ZYT World 最大的看点在于"记忆"和"闭环"这两项能力。
世界模型相较三维重建最大的好处就是场景可编辑。但模型有幻觉,同样一段路AI每次经过时环境可能都不一样。
卓驭的解法是让世界拥有记忆。首创的"记忆回溯模块"能做到:AI换条路驶回去过的路段,模型会把路牌、路边停着的车再重现回来,而不是随机再编一个,或者直接跳过。
另一半是评测方式的改变。行业通常采用开环测评:AI只是看录像、握一个不插电的方向盘。它说"我会打左",录像不会因此改变,下一帧仍然是人类老司机开出来的画面。
这种训练和评测方式有个绕不过去的毛病:生成的内容不可控、重建的世界改不动,而不自己上手,AI永远没有机会犯错,也就永远学不会纠错。
卓驭做的是闭环强化学习:AI的每一个决策都会导向不一样的后果,再通过强化学习的奖惩机制,让它自己摸索出一套高分策略。从开环到闭环,变的不是仿真精度,是AI第一次要为自己的决策负责。

它能做到什么?AI拥有自己的 “GTA”世界
GTA系列游戏的特点是画面真实,你抢到的车下次不会换个颜色或者直接消失,你在游戏里的所有举动都会有对应的后果。卓驭同样为AI司机做了一座与现实共享物理逻辑的平行世界。
符合AI真正看到的世界:
现实中车上的传感器形态各异,有的看得远,有的看得广。常规方案做不到面面俱到,导致生成的画面和AI司机现实里看到的不一样。
ZYT World 做到了虚拟世界与现实一致,也就是所谓"多目异构"——鱼眼是鱼眼、针孔是针孔,并严格对齐同一物理时刻。同样的数据换套相机位置和参数,就成了重卡、物流大小车视角的数据,能做到跨垂类拓展。
世界中的环境可控交互
  • 控自己的车:同一起点,掉头和刹停是两个世界
  • 控旁边的车:前车急刹、旁车加塞、电瓶车从盲区窜出
  • 控道路环境:直路改岔路、绿灯提前变红
模型世界真实稳定不会“卡”
实时,只要两张卡。40步压到1步,再配整套推理加速:生成器比40步老师快107.7倍,解码器快59.8倍,显存省约27倍。
图片
有界KV-cache机制让显存占用不随时间递增,训练数据仅覆盖8秒时序片段,仍能完成分钟级连续输出,车道、建筑与光照效果维持稳定。

它是怎么做到的?
底座是"逐帧接龙":每步只生成一个时刻的多视角画面,写进KV-cache再推下一步;两路Plücker adapter分别编码鱼眼和针孔的射线几何,自车运动、他车与车道布局逐帧注入。
压缩本身不难,难的是压完还得稳。从40步压到1步,卓驭分四轮完成:
先让模型只看过去的画面,与上车条件对齐(因果化);再把去噪路径切成48个小台阶逐段逼近(一致性蒸馏);然后放它用自己的输出往后接20个时刻,由教师模型当场纠偏(自回滚DMD);最后加一道跨相机校验(RigCritic)。画质仍保住40步的九成以上。
其中,后两轮是为了让世界跑久了不变形、几个摄像头不矛盾——否则AI是在一个假世界里练车。
记忆模块是零初始化插件。 接上对基座几乎零影响,不接就整层跳过。训练数据用端到端模型在真实场景生成替代轨迹再重建渲染,已攒近百万对。
剩下的时间靠推理栈抠。 19M参数TinyVAE、W8A8低比特矩阵乘、自研推理框架做硬件感知优化,单次推理再快1.6倍;两张GPU协同拿到1.7倍;叠加1步生成的时延优化,合成107.7倍,撑住实时推理。
图片
和 Waymo、特斯拉、英伟达、华为摆在一起,它在哪一格
之前李飞飞把世界模型拆成3种功能:渲染器(输出给人看的画面)、仿真器(输出程序能算的几何与物理状态)、规划器(输出动作)。那么准确来说,ZYT World是造一个能被驶入、可改写、且记得住路的平行世界。
这一格的玩家已经不少:Waymo World Model建在Genie 3之上做领域后训练,直接生成摄像头和激光雷达数据;特斯拉用生成式高斯泼溅做"如果当时换一种开法"的反事实回放;英伟达用Cosmos造数据、Alpamayo出动作;华为ADS 5云端用世界引擎造场景。
ZYT World的差异化在于这个世界真的可以直接拿来实时训练学习(闭环强化学习),同时它已经真实接进了量产研发流程。"每次发版贡献超20万场景闭环用例"这个数字,比任何一项加速比都更能说明它的实际价值。
文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多