形机器人的视频,通常是在比体能:后空翻、跑步、搬箱子、拧螺丝。不过,最近小鹏机器人拟人实验室发布了一个 5 分 45 秒的视频,视频中机器人双脚几乎没移动过。它做的只有一件事——站在三个人中间,把「该看谁、认不认得你、用哪种语言回答」演了一遍。
小鹏IRON这个不比后空翻的视频逻辑背后是:小鹏认为人类交流本来就是一种多模态、具身化的行为,机器人要进入人的物理世界,仅仅理解语言是不够的,还需要理解那些人类从来不会特意说出来的交互规则。
所以,小鹏这次发布的视频其实是测试了机器人的身份建立、理解与记忆、具身交互、社会化共处四个能力。需要先说明的是,这是研发版演示,不等于用户明天就能买到的功能。
下面Vehicle基于视频来给大家分析下小鹏机器人拟人实验室发布这个视频背后的产品技术。
第一段:一台不挪脚的机器人,先学会转身
测试背景是,三位测试者轮流开口,还会中途换位置。IRON 每次都把身体转向正在说话的那个人,而且转的幅度不一样:有时只是偏一下头,有时连腰一起转,有时整个身体转过去。
这件事听起来简单,实际是两个问题叠在一起。
第一个问题是找人。人在嘈杂环境里能听出声音从哪个方向来,机器也可以,官方给的方案是 9 麦克风阵列做声源定位。但声音只能告诉你方位,说不清是谁——三个人挨在一起,声音来自同一片区域,定位再准也分不出人。所以还有第二步:用视觉看嘴。小鹏表示其可以「多模态融合机制识别唇部运动,锁定说话人」,说白了就是看谁的嘴在动,把声音和人对上。
第二个问题是怎么转。人跟人说话时调整身体是下意识的,角度小就转头,角度大才挪身子,不会每次都原地打转。IRON 要复刻这种分寸感,就得把头、腰、腿一起调度起来。视频里工程师用的说法是「声学、视觉、运控,多套系统严丝合缝」。

四段能力与时间码均来自官方观看指引;画面为能力片抽帧,版权归小鹏汽车
第二段:中文说到一半换德语,它没有「切换模式」
接下来,一位测试者把中文换成德语,IRON 直接用德语接着聊,没有先选语种,也没有任何「已切换至德语」的提示音。最后,它还用德语把车型推荐说完了。
这段的技术解释分三层:用的基座模型本身就带多语言能力,之后做多语言后训练,再把不同语言的训练数据配平。翻译成日常语言,就是让它从一开始就同时「长」在几种语言里,而不是听完中文先译成内部语言、再译成德语说出口。人在双语环境里长大也是这个状态:对方换了语言,你跟着换,中间不需要一个切换动作。
第三段:记住你,靠三条线索对齐
最后,是我认为设计得最用心的一段。三位测试者换了位置,还换了衣服,IRON 依然把他们和之前的对话对上号,画面上给每个人挂出卡片:小白是新手司机,想要好看又好停的车;小黑是三娃家庭,打算买 G9L 去露营。
换衣服这个动作很关键。如果只靠外观识别,衣服颜色、站的位置都会成为廉价的判断依据,演示当然好看,换个场景就崩。官方的做法是人脸、声纹和对话内容三路信息一起建档,让同一个人在不同时间、不同状态下都指向同一份记忆,并且这份记忆会持续累积更新。IRON 在中途说了句「我可把你记得清清楚楚」,指引里把参照系直接定成了人:人时间久了容易忘,认识的人多了容易记混。

第四段:问答,答案落回自家车型
最后,是导购场景。IRON 结合本地知识库和联网检索回答问题,再叠加前面存下的偏好继续推荐。三娃家庭问空间,它答 G9L 的后备箱装得下全家露营装备;片尾字幕写的是「他能了解你的喜好,并主动推荐」。
支撑这段的是本地算力:3 颗自研图灵芯片、有效算力 2250 TOPS,模型跑在机器人身上,不用把画面和对话传去云端。这个思路和它在车上的说法一致,端侧推理既压时延,也少一层隐私顾虑。
这四段能做出来,因为座舱已经练过一遍
看到这里,熟悉小鹏车机的人应该有点眼熟。
VLM 是视觉语言模型的缩写,通俗讲就是一个既能看画面、又能听懂话的模型。小鹏今年 1 月推送的天玑 AIOS 6.0,主打的正是这个东西。座舱里的摄像头看乘客的穿着和状态,系统主动调温度、开除雾、调音量;偏好存在一个本地的「个性化记忆库」里,官方给的座舱侧有效算力约 750 TOPS。8 月的 XOS 6.3.0 又往前走一步,用整车大脑 Master Agent 把负责开车的 VLA 和负责懂人的 VLM 打通,一句模糊的话能被拆成任务派给各个模块。
把两边摊开对比,能力是一一对得上的:座舱看穿着看状态,机器人看唇动看方位;座舱能接多轮对话和模糊指令,机器人能中德混说;座舱有本地记忆库存偏好,机器人有人脸声纹绑定的对话档案;座舱按本地知识加联网主动推荐,机器人按家庭约束推车型。
换掉的是执行机构。在车上,理解完用户之后能动的是空调、导航、音量和泊车;在 IRON 身上,能动的变成了头、腰、腿和手势。中间那层「看懂人、记住人、答好人」的能力,是同一道题。
所以这支片子的取材就好解释了:小鹏先派出的是自己唯一经过量产验证的那一层。按官方在 2025 年 11 月发布会上的分工,IRON 的大小脑由 VLT、VLA、VLM 三部分组成,VLM 管对话交互,VLA 管动作行走,VLT 管思考决策。这四段基本都是 VLM 的活儿,只有转身那一下用到了运控,VLT 全程没有单独露面。

座舱侧为公开报道口径;两侧模型如何共用权重与数据管线,官方未披露
也要看清片子没给的东西
演示是受控的:三个人、一间黑色布景室、没有人流干扰,官方也没公布测了多少次、失败多少次。这四段出自同一条时间线上的一次演示,换个嘈杂的商场再测,结论才算站得住。
还有几件事没答:记忆能存多久、能记几个人、怎么删;座舱模型和机器人模型到底共享多少权重;导览导购作为首批场景,进哪家门店、什么时候进;以及最要紧的一件:带路、递东西这类得动起来的任务,什么时候能测。82 个自由度、猫步、22 个自由度的手,其实这些机器人硬骨头一个没测。
把机器人从遥控玩具变成能自主干活的机器,难点一直在手和脚上。但这次小鹏这支片子绕开了那部分,他先证明另一件事:它能像人一样站在人群里,知道该看谁、记得你是谁。
写在最后
当然,这可能不是小鹏避重就轻,而是现阶段最省力的一步——这层能力已经在几十万辆车的座舱里跑过一轮。不过,机器人真正的分水岭还在后面,等 VLT 和 VLA 交卷的那天,再看它能不能把东西递到你手上,那才是真正的Physical AI人形机器人。







