Token导航 LogoToken导航

智元灵犀X2与远征A3亮相湾区升明月晚会

更新时间 2026-09-22来源 亿欧网正文 1621字阅读约 6分钟5 张图片

图片

9月20日,“湾区升明月”2026大湾区电影音乐晚会在澳门举行。智元机器人派出两套产品进场:双足人形机器人灵犀X2负责舞台伴舞,远征A3进入晚会直播间做实时交互。

对具身智能来说,这种文娱直播场景不一定比工厂产线更容易——灯光、噪声、即兴对话、临时动线,都是对模型和本体的综合考验。

图片

直播间里的交互,不靠剧本

晚会开始前,远征A3在直播间与王祖蓝等主持人、艺人互动。官方将其交互能力归结为自研WITA-Omni端到端全模态模型:视觉、语音、语言、表情、肢体动作放在统一决策空间里处理,而不是先语音识别、再文本大模型、最后驱动动作这种串联方案。

图片

区别在真实场景里更明显。直播间不是一对一问答,而是多人轮流说话、随时插话、话题跳转。机器人要判断“现在该不该接话”“接哪一句”“用语音还是先用动作回应”。这类打断恢复、情绪识别、场合分寸,恰好是全模态交互比纯语音助手更难的地方。

智元给出的评测背书是DailyOmni榜单:WITA-Omni Preview在2026年7月该榜单取得85.21分综合第一,官方称超过千问、Gemini、豆包、英伟达等模型,重点考察音视频联合理解与时序推理。但榜单分数归榜单分数,晚会直播间的价值在于把模型放进非受控环境——没有固定脚本,艺人临场发挥,摄像机、音响、观众声场都在变。能否不冷场、不抢话、不答非所问,比单轮问答更接近商用标准。

舞台伴舞,考的是运动控制而非编舞

灵犀X2的任务是《爱情鸟》伴舞:主舞台一台领跳,两侧各两台协同,观众席另放一台做互动。表面看是文娱表演,底层考的是节奏跟踪、队形同步、中间姿态规划和突发停启。

图片

智元把运动能力放在“三智一体”架构里讲——运动智能、交互智能、作业智能并列,本体作为执行载体。运动侧用AGILE(AgiBot Generative Intelligent Locomotion Engine)生成式通用小脑引擎,包含BFM-2通用行为基础模型、GCFM生成式运动控制模型、REACT感知运动模型三层,目标是把“视觉感知—小脑决策—肢体控制”做成闭环,让机器人在非固定动作序列下也能实时调整。

这对商演场景很关键。传统机器人舞蹈可以多靠离线编舞、重复回放;但晚会现场会有音乐延迟、走位偏差、其他演员临场变动作,机器人如果只会回放轨迹,容易出现卡点漂移或避障失效。

灵犀X2这次展示的重点不是“会跳舞”,而是能否把编舞转成可在线修正的运动策略。

文娱场景的价值,不在“秀”而在“部署态”

具身智能过去两年常被诟病“展台很能打、现场很拉胯”。

智元把人形机器人送进晚会,逻辑不完全是品牌曝光,也是在验证两类可迁移能力:远征A3验证服务交互——直播、导览、接待、零售咨询都可复用;灵犀X2验证轻量双足在文娱商演中的可复制性,降低对人肉编舞和现场调试的依赖。

图片

从产业角度看,文娱直播属于高容错但高不确定性的场景:不像工业产线要求±0.1mm和连续无故障,但比封闭工厂更考验模型对“人”的适应力。

智元如果要把“科研态”推进到“部署态”,这类公开场地反而更适合做交互和运动模型的真实数据回收。

更大的背景是人形机器人正从单机演示走向规模交付。智元官方此前披露“一体三智”架构和XYZ部署曲线,强调从开发态转部署态;其量产与工业、物流、服务方案也在同步推进。

晚会这类项目未必直接产生产线ROI,但能压缩两个成本:一是交互模型在真实人群中的调试成本,二是双足本体在非工厂环境下的运维经验。

写在最后:

人形机器人上晚会,容易被看成营销。

但把远征A3的对话、灵犀X2的伴舞拆开看,本质是两套技术栈的公开巡检:全模态交互看“懂不懂人”,生成式运动控制看“跟不跟得上现场”。

具身智能要不要进文娱可以有争议,但这类非受控场景,确实是实验室指标之外更硬的校验场。

对智元而言,下一步问题不在晚会能不能跑完,而在同样一套WITA-Omni和AGILE,能否从舞台、直播间复制到商场、场馆、产线和长期运维中——那才决定“部署态”是不是口号。

文章标签机器人应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多