
世界模型赛道再迎一笔重磅早期融资。由北大博士领衔的世界模型初创团队,完成3000万美元新一轮融资,投后估值达到2亿美元。本轮融资落地的核心看点,在于其自研视觉符号体系,将AI视频生成的算力成本压缩至传统方案的十分之一。在全球大厂扎堆投入巨型世界模型的行业背景下,这支小团队走出轻量化技术路线,也为国内世界模型赛道提供差异化的探索样本。
3000万美金融资落地,资本押注轻量化世界模型
本次融资由多家头部美元基金参与,资金将全部投入世界模型底层架构研发、视频数据集建设与推理引擎优化。和当下市场普遍认知不同,这家初创团队没有选择堆砌超大参数量模型,而是另辟蹊径,构建一套面向AI的视觉符号系统,替代传统文本描述来表征视频里的空间、运动、光影信息。
团队核心创始人毕业于北京大学,长期深耕视觉生成与世界模型基础研究。团队规模保持精简,核心成员以AI基础算法、视频编解码、分布式推理方向人才为主。资本选择在早期阶段重仓,看重的不是短期C端产品,而是这套全新视觉表征框架带来的成本红利。
在当前行业,视频生成模型推理成本居高不下,一直是限制商业化落地的最大阻碍之一。常规视频生成方案,依靠文本转图像、逐帧生成的模式,长时序视频会带来极高算力消耗。该团队的技术路径,不再用人类自然语言描述画面,而是建立一套AI原生的视觉符号词典,直接编码视频的动态物理信息,减少中间转换带来的算力损耗。基于这套架构,视频生成成本实现量级下降,生成视频的算力开销相比主流方案压缩至十分之一。
路线分化:巨型模型vs轻量化符号路线
当前全球世界模型赛道,形成两条清晰的路线之争。一条是以海外大厂、头部实验室为主的路线,投入数十亿资金,训练超大规模世界基座模型,依靠海量算力去学习物理世界规则,代表项目投入资金、卡量规模巨大,研发成本高昂。
另一条就是这家北大创业团队选择的轻量化路线。团队认为,自然语言本身存在表达局限,很难完整、高效描述复杂动态场景。文字无法精准表达物体运动轨迹、光影连续变化、空间相对位置,文本到视频转换过程会持续产生信息损失,额外消耗算力。他们构建的视觉符号体系,专门用来记录视频中的动态信息,AI可以直接读取符号完成场景推演与视频生成,省去文本翻译环节。
这条路线的优势,体现在两个层面。第一是推理成本大幅降低,让长时序、高分辨率交互式视频生成具备商业化可行性;第二是训练阶段对算力资源的需求更低,初创小团队不需要万卡级集群,就能完成模型迭代。但该方案同样存在挑战:全新符号体系需要海量视频数据完成预训练,符号系统通用性、跨场景迁移能力,仍需要大量实测验证,距离大规模产品化还有一段距离。
世界模型的核心目标,是让AI能够理解、预测物理世界的变化,不只是生成静态画面,还可以预判物体运动、环境交互结果。未来无论是数字孪生、虚拟仿真、具身机器人训练,都需要世界模型作为底层引擎。而视频生成,只是这套底层能力最先落地的应用场景。
成本下探打开产业空间,但商业化考验仍在
视频生成成本下降一个数量级,意味着下游应用的商业模式将被改写。在数字内容生产、虚拟场景搭建、机器人仿真训练等场景,过去高昂的算力费用,限制企业大批量调用视频模型。当成本大幅降低,企业可以大批量生成仿真视频,用来训练具身智能、自动驾驶仿真场景,或是批量产出影视、广告数字素材。
但赛道的商业化挑战依然客观存在。其一,新的视觉符号架构能否适配多样化场景,通用能力能不能追上主流大模型,需要持续验证。其二,赛道竞争持续加剧,国内已经有多支世界模型团队拿到融资,各自采用不同技术路线,赛道尚未出现统一技术范式。其三,虽然推理成本下降,但高质量视频数据集的采集、清洗、版权成本依然高昂,这是所有视频生成企业共同面对的难题。
资本本轮下注,本质是押注下一代AI交互范式。当前大模型以文本对话为主,而世界模型的终极形态,是AI直接感知、模拟三维动态世界。视频生成只是阶段性的应用出口,真正的长期市场,在物理仿真、机器人、数字孪生等B端工业场景。
结语
这笔3000万美元融资,是国内世界模型赛道差异化路线的一次标志性融资事件。当行业普遍追逐超大模型、海量算力的时候,北大这支初创团队选择从底层表征方式入手,用全新视觉符号体系压缩视频生成成本。
世界模型还处在技术探索的早期阶段,没有哪一条路线被证明是最终答案。轻量化低成本路线能否持续迭代,从实验室技术走向产业落地,还要看后续模型能力迭代、场景实测结果。而这条技术路线带来的启示是,下一代AI的竞争,不只是算力与参数的比拼,底层信息表征方式的原始创新,同样可以重塑行业成本曲线。







