
具身智能行业过去两年最容易被外界记住的,是机器人后空翻、跑酷、叠衣服的演示视频。
但真正要把机器人送进工厂、家庭、商业空间,问题往往不在“某一个动作会不会做”,而在整条任务链能不能跑完:先听懂人在哪、要去哪,再知道全身怎么配合取放、开关、避人,中间被撞一下、被绊一下、某个关节状态变了,还能自己调整继续干。
亮源新创过去一段时间连发三项技术,恰好不是按“单个炫技动作”排的,而是按这条完整链路在补:通用导航大脑LightNav-0解决“去哪、怎么走”;全身智能基础模型Light-O1解决“看见情境后全身怎么行动”;机器人全身韧性智能技术Light REACT解决“真出扰动、跌倒、硬件状态变化后怎么不停机”。
再往前,LightParkour补齐复杂地形下的全身运动技能。

三条线合起来,对应其“规模化预训练—规模化对齐—规模化部署”的Physical AI路径。
先解决“去哪”,再解决“怎么做”
导航是机器人进入物理世界的第一关。
传统做法是某一台机器人、某一个场景单独采数据、调模型,换本体或换环境就要重来。

LightNav-0的思路是用Real2Sim2Real把真实世界先“搬进”仿真:2000多个真实室内外场景转成可复用仿真资产,再合成4000多小时视觉—语言—动作经验,经过具身推理中期训练、监督微调和在线强化学习,形成单一导航模型。
它的关键不只在数据量,而在“一个权重多本体可用”。
亮源表示,LightNav-0可零样本部署到人形、四足、轮式、飞行机器人,接自然语言指令完成跟随、找物、视觉跟踪等任务,不依赖目标机器人重新采集导航数据,也不需要按新场景微调。
对行业来说,这代表一种更省力的对齐方式:真实场景定分布,仿真扩规模,语言作为统一接口,导航从“逐项目工程”变成“可复用基础能力”。
导航把机器人带到目标附近,真正干活要靠全身操作。
过去机器人动作模型大量依赖遥操作、UMI等专用采集:人戴设备示范,或拿采集硬件做任务,数据真、可执行性强,但人力、设备、场景组织成本都高,任务和本体一多就难扩展。

而Light-O1换了个数据源:从互联网视频里提取人类全身行为,把移动、取物、用工具、开关柜、与人交互等动作转成统一多模态动作数据,再结合语言、视觉做自回归预训练,形成“什么情境下如何全身行动”的先验,最后用目标机器人数据适配到不同本体和视角。
亮源把基于视频的人类动作预训练推到10万动作小时,并在第一视角人类数据、公开人形数据、自有全身移动操作数据上验证:预训练规模越大,适配后动作预测损失呈幂律下降,全身姿态误差也随之降低。并将其概括为“跨本体迁移扩展规律”——人类行为数据越多,迁移到不同机器人身上的收益越稳定。
这套逻辑的价值在于,它把“教机器人”从“人拿着机器人硬件示范”部分转成“人看视频、模型学人再适配机器人”。
互联网视频的规模远大于单家公司的遥操作库,行为多样性也更高。搭载Light-O1的LightBot做递毛巾、开鞋柜归置拖鞋、捡垃圾等任务,重点不是单个动作漂亮,而是把语言理解、空间感知、移动导航和全身操作连成一段连续执行;物品位置变了、被干扰了,能基于环境反馈重规划。
同期开源的Light-O1-Preview更进一步把“自然语言目标→全身动作推理”做成可体验产品:用户说目标,模型推姿态、顺序和约束,再出全身动作。它把基础模型能力前置到“人机沟通”环节,让非机器人工程师也能定义任务。
出意外怎么办?
很多演示在受控环境下很顺,但真实空间不可能不受扰。
Light REACT要补的就是这一层。

它把外力推搡、跌倒、部分关节失效、整条腿断电等情况放在同一个全身控制策略里,用“全身上下文学习”替代故障标签和人工切模式:机器人读最近一段本体感知、动作和执行结果,自己判断当前身体还能做什么,能走就走,不能直立就跛行、单足跳,再不行就调用手臂转爬行。
亮源把这种能力分成韧性金字塔:常规推扰保持行走,强扰后自主起身,硬件损伤后改步态,严重到不能直立再爬行。
训练上用多类损伤教师策略蒸馏成单一学生策略,再用偏好强化学习对齐“能直立优先直立”的行为选择。
对规模化部署而言,这一步的意义很直接:机器人不因一次跌倒或单个关节异常就停工,运行经验能持续产生,后续模型迭代才有稳定数据来源。
三条线拼起来,看到的是“可扩展Physical AI”而不是单点模型
单独看,LightNav-0是导航对齐,Light-O1是全身动作预训练,Light REACT是部署期韧性控制,LightParkour是复杂地形技能。
放到一起,逻辑会是这样:
预训练层用人类视频和互联网场景建立“行为先验”,解决全身动作从哪学、如何跨任务复用;
对齐层用真实—仿真—真实把导航、语言、场景偏好压成可零样本部署能力,解决“按人类指令稳妥执行”;
控制与部署层用上下文学习处理扰动、损伤、跌倒,解决“长期运行不停机”;
运行数据再回流,推动下一轮预训练和对齐。
这比“一个模型包打天下”更工程化,也比“导航、控制、操作各做各的”更成体系。
它的核心判断是:物理世界智能不一定先追求单台机器人动作极致,而要先让数据、模型、本体、场景之间形成可复制扩展——新本体接入时少重采,新场景接入时少微调,真机出状况时不人工救场。
具身智能的下一阶段,竞争会从“动作库”转向“行为数据源+跨本体基础设施”
亮源这套发布节奏,反映出行里几个更明确的走向。
第一,人类行为视频会成为机器人基础模型的重要预训练燃料。遥操作贵、真实机器人采集慢,而互联网视频、第一视角视频、教学视频的行为多样性足够大。谁能把人体动作稳定retarget到不同本体,谁就更容易把数据规模做成优势。Light-O1的10万小时和跨本体幂律,是在给这条路线提供经验证据。
第二,导航、操作、控制不会再完全分家。过去导航归SLAM/VLN,操作归VLA/模仿学习,控制归动力学/强化学习;但真实长任务要求“听懂—走到—全身做—受扰恢复”一气呵成。LightNav-0提供空间与语言接口,Light-O1提供全身行动先验,Light REACT提供执行韧性,三者共用语言、视觉和本体状态,代表横向打通而不是纵向堆功能。
第三,零样本跨本体和部署期自适应性会成基础指标。机器人如果要进多家庭、多工厂、多商业场景,不可能每台都重采重训。模型层面支持人形/四足/轮式/飞行共享权重,控制层面支持无故障标签自适配,会逐步从“亮点”变成“采购前提”。
第四,开源会成为基础模型公司建立生态的方式。LightNav-0开权重、代码、技术报告和评测,Light-O1-Preview开动作生成体验,本质是把外部开发者、科研团队和场景方拉进数据—反馈循环。对创业公司来说,闭源做演示容易,开源做可复现才更容易沉淀长期壁垒。
具身智能离大规模商用还会有很多工程问题,但行业正在从“证明机器人能做什么”转向“证明机器人能稳定、跨场景、少人工干预地一直做”。
亮源这条由导航、全身预训练、韧性控制组成的三段线,不一定是所有公司的最终形态,但提供了一个可观察的样本:把人类行为作为数据底层,把语言作为任务接口,把抗扰动作为部署底层,物理世界智能才有可能从演示室走到真实业务里。







