
高飞从小的梦想是当一名飞行员。
小时候,他家附近正好有一条战斗机航线,飞机时常从头顶飞过。一次次仰头看着它们掠过,让“飞行”很早就在他心里留下了印象。“而且我的名字就叫高飞,喜欢飞行,多少有些命中注定。”
为了有一天能够坐进驾驶舱,他还在家里贴了一张视力表,每天放学后回家的第一件事,就是跑到视力表前,检查视力是否还保持在 2.0。但后来,因为太喜欢看书,他的视力不再达标,飞行员的梦想似乎就此搁置。
或许真的是命运的安排,长大后,高飞以另一种方式回到了“飞行”——18 岁进入浙江大学后,他选择了自动化专业。那几年,正逢四旋翼飞行器兴起,他也在社团活动中第一次真正接触到无人机,很快就被吸引。此后,他一头扎进飞行机器人研究,再没有离开这个方向。
很多人最早是通过互联网认识高飞和他的团队。除了发表论文,他们很早就在视频平台开始公开代码和演示视频,其中一些研究视频的播放量甚至超过百万。后来,团队又把无人机从硬件组装、环境配置到算法部署的完整过程做成免费课程。
从 EGO-Planner、EGO-Swarm、Fast-Tracker,到 2022 年发表于《Science Robotics》的微型飞行机器人集群研究,这些工作随着代码、视频和课程不断进入开发者社区,也吸引了不少学生和研究者跟着复现。
“我自己就是开源的受益者。”他说,“工程师的开源精神就是:我做了一个好东西,希望别人不要再重复造轮子,可以直接在我的工作上搭建自己的工程。”
如今,高飞是浙江大学控制科学与工程学院长聘副教授,曾入选《麻省理工科技评论》“35 岁以下科技创新 35 人”亚太区榜单,最近还刚刚获批国家青年科学基金(A 类)项目。这些年,他的研究从单机自主飞行不断延伸到集群协同、飞行操作和具身智能。2024 年底,他创办微分智飞,开始把这些积累进一步推向产品和真实场景。
一方面,微分智飞已经推出能够在无 GPS、无先验地图环境中自主导航的飞行机器人,面向应急、测绘、矿井、隧道、工业巡检等复杂场景;另一方面,高飞团队还研发了 HI-ARM 飞行操作机器人,为无人机添上机械臂,探索其更多形态。
这些工作的背后,都指向他今天所说的“飞行智能”。在高飞看来,无人机已经越来越会“自己飞”,但“自动”“自主”和“智能”并不是一回事。真正的变化,不只是飞得更远、更稳,而是能否理解任务、判断环境,并自己决定下一步该做什么。
“硬件是底座,它决定能力下限;智能决定上限。”高飞说。
这次,我们和高飞聊了聊他从飞行梦走向飞行机器人的十几年,也继续追问:当无人机从自动走向自主,再走向智能,它该如何理解世界、完成任务?单机智能又如何扩展到群体协作?以及,当“飞行智能”真正成熟,低空经济会被带向怎样的下一阶段?
以下是 DeepTech 和高飞的对话:
从飞行梦开始,把研究做成产品
DeepTech:很多人最早是在互联网上认识你。你和团队很早就把无人机自主飞行的代码、演示视频放到网上,EGO-Planner、EGO-Swarm、Fast-Tracker 这些项目也被很多开发者复现。为什么这些开源项目当时会传播得这么广?
高飞:首先,学术界和应用界确实有这样的需求。大家需要一个真正能解决问题、代码实现与论文一致、即插即用的无人机自主规划器,让无人机能够规划、避障并完成任务。
EGO-Planner 解决单机规划问题,EGO-Swarm 可以理解为多机集群版本,Fast-Tracker 则是跟踪系统。它们的内核是一致的:在保证飞行稳定和安全的前提下,让无人机在存在障碍物的环境中完成任务。比如,单机从 A 点飞到 B 点;多机分别从不同起点飞向不同目标点;跟踪系统则是在从 A 点到 B 点的过程中持续跟踪目标。
机器人研究有一个特点,成果很难复现。它不像纯软件的计算机视觉工作,拿到源代码后通常比较容易运行起来。机器人系统各部分之间的依赖关系非常强,真正做到即插即用并不容易。我们的工作一方面让初学者可以快速上手并看到效果,另一方面保证论文描述与代码实现一致。
而这些项目之所以获得社区认可,我认为归根到底,是因为它们踏实地解决了避障、规划和跟踪等实际问题,而且能够真正在不同二次开发者各自的平台、环境上运行起来。
DeepTech:你们一直愿意公开代码、演示视频,甚至把整套无人机系统课程放出来。为什么这么重视开源?
高飞:首先是因为我自己就是开源的受益者。我读博士时正好赶上机器人生态的蓬勃快速发展。社区里的很多人都是凭着热爱在做贡献,代码和技术文档都是开源的,大家在多年内持续参与建设。
我本科时对机器人还不懂,我能够入门,基本靠的就是开源资源。如果没有开源社区和前人的贡献,当时的学生很难找到学习资源。这是一种“我为人人、人人为我”的精神,也是一种很朴素的工程师分享精神。我做了一个好东西,希望别人不必重复造轮子,可以直接用它搭建自己的工程。
这种经历也影响了我们现在做产品和生态的方式。在不影响商业化的情况下,我们仍然愿意开源,也重视开源社区建设,会持续开放一些代码。产品真正有竞争力,并不会因为开源就必然造成商业利益的损失。现在的开源大模型也说明,开源既能获得用户口碑,也可能取得商业成功,两者可以相辅相成。我认为在开源生态之上,存在一种开源经济学。
当然,什么可以开源、什么不能开源,需要灵活取舍,不能一概而论。企业需要保留技术壁垒,同时也可以通过贡献社区,让更多人更容易学习和入门。别人愿意跟随你的技术路线,本身也可能形成长期的商业价值。
DeepTech:你当时是怎么决定创业的?
高飞:第一个原因,是我从小就比较认同产业化和做产品这件事。我父亲是一名优秀的工程师,不只做研发,也会自己做产品。小时候家里有很多他做的小发明,有些专利后来真的做了产业化。
这件事很早就在我心里埋下了一颗种子:做工程,最后不能只停留在纸面上。
后来我选择科研,做了很多年科研以后慢慢发现,如果一直不去完成产品化和工程化的那一段,我会有遗憾。我做的毕竟是工程学科。工科完整的技术链条,是从机理和底层原理出发发散出很多可能,发展到少量真正可行技术路线在验证后的收敛,再到最后的 engineering。而真实的 engineering 就意味着别人可以使用的 product。
我从本科开始接触科研,到读博士、在浙大当老师,前前后后已经十几年。到了这个阶段,在不断突破科研前沿问题的同时,我还是希望离真实应用更近一些。
另外这也是时代机会。现在 AI 和硬件的深度结合,有机会让过去的机器人从自动化设备变成自主设备,甚至进一步真正实现智能。
(来源:受访者)
自动、自主和智能,是三个不同阶段
DeepTech:你刚才提到 AI 带来的机会。但过去的无人机似乎已经足够智能了,可以自主定位、规划或者避障。你现在强调的通用飞行 AI、飞行具身智能,与过去最核心的区别是什么?
高飞:过去无人机的硬件本体其实已经非常成熟,在可操控性、成本、稳定性和可靠性上都做得很好。
但说到自主导航和避障,距离真正落地还有差距。过去的系统可以在有限场景下完成一些简单避障,却很难在完全未知、没有先验信息的环境里自主完成任务。
这里有一个经常被混淆的问题。自动、自主和智能,其实是三个不同阶段。自动化,是重复完成一件预先规定好的事情。比如无人机依赖 GPS,在已经知道 A、B 两点坐标的情况下反复巡线,本质上还是 automation。
自主意味着把完整的任务闭环交给机器人。环境和坐标可能都没有提前给定,但它能够自己寻找路径、处理变化,最后把任务完成。
智能还要再往上一层。它不仅能完成一个任务,还能理解不同任务,并把一个复杂目标拆成多个子任务,再把它们组合起来。这背后需要认知、理解和泛化能力。
所以过去很多工业无人机其实只能做到自动,连真正的自主都很难。AI 的进入,有可能先推动自主问题的解决,再进一步走向智能。
DeepTech:你们最近展示了让无人机“替人取一杯咖啡”的任务。在这个场景里,相比过去的无人机,真正新增了哪些能力?
高飞:首先,机器人要理解“取咖啡”意味着什么。人听到这句话,会自然想到去咖啡店,但机器人并不知道店在哪里、怎么过去,也不知道途中会发生什么。这些都需要它自己理解,把一个模糊指令拆成一系列任务。
接下来,它还要完成目标搜索、导航避障、路径规划、物体拿取和结果验证,并在过程中持续处理环境里的不确定性。
所以真正新增的不是某一个单独能力,而是一整套智能能力:理解任务、发现信息缺口、主动获取信息、采取行动,最后验证结果。
在这样的系统里,人也不需要再把整个任务流程提前编排好。无人机本身可以具备搜索、导航、避障、跟踪等一系列原子能力,端侧的“大脑”根据任务判断下一步该做什么,再调用和组合这些能力。它更像一个智能体,人只需要给出目标。
(来源:受访者)
DeepTech:但现实环境里一定会出现意外情况。比如途中突然有人进入视野,或者原来的路线无法继续,系统会怎么处理?
高飞:它一定要持续重新规划。如果只在出发前规划一次,后面不再纠错,本质上还是开环。现实环境里一直存在扰动和偏差,任务越长,误差就越容易累积。
所以系统需要滚动规划,根据新的观测不断判断当前状态是否和预期一致。如果环境发生变化,就重新调整路径或者任务步骤,持续纠错,直到把整个任务闭环完成。
DeepTech:你今年在《国家科学评论》(National Science Review)提出了 Command–Measurement–Action 框架。相比现在常见的“Command– Observation–Action”路线,为什么要强调 measurement?它和 Observation 差别是什么?
高飞:当前具身智能的一条主流路线,是根据 command 和 observation 直接得到 action。但对飞行机器人来说,这还不够。
无人机要在遮挡多、未知区域广的复杂环境中高速机动,这和两类典型场景有明显区别:双臂机器人大多在准静态的有限空间内作业;自动驾驶则运行在规范建设、规则明确的结构化道路上。因此,无人机在输出动作前,必须评估现有观测信息(observation)和持续预测可能获得的未知信息,来判断现有信息是否满足任务目标并结合对未知信息的预测生成 action,这一分析预测过程就是 Measurement。
Command-Measurement-Action 想强调的是:对飞行机器人来说, 不应该被动地获取信息, 其对信息的实时、深入评估是非常关键的一环。而且对很多飞行任务来说,action 本身并不是目的, 无人机进入一个环境, 往往是为了获取、处理并带回信息, 飞行动作只是完成任务的手段,这也是飞行机器人不同于其他形态机器人很特殊的一点。
DeepTech:你们最近还发布了 HI-ARM 这类带操作能力的飞行机器人。为什么会想到给无人机加上“手”?
高飞:我们其实探索过几种不同形态。有的是在飞行器下方安装轻量机械臂,也做过一体化的仿生“飞行手”,它既能飞,也可以抓握、形变、拿取物体。
这个想法来自一个很基础的判断:机器人有两种通用能力,一种是移动,一种是操作。
无人机过去很多年的发展,主要是在强化移动能力。飞得更快、更远、更灵活,而且不依赖地面,能够进入很多其他机器人到不了的地方。但如果一直只有移动能力,它充其量还是一个“会飞的眼睛”,可以采集信息,却无法真正与物理世界交互。
比如在工业现场,无人机可以完成缺陷检测、故障诊断和危险信息采集,但发现问题以后,往往还是要人重新进入现场处理,这其实只完成了任务的前半段。
如果让飞行机器人具备一些基础操作能力,哪怕不需要非常精细,只是拿取物体、按压开关、拧螺丝或者操作阀门,它能够完成的任务就会完全不同。
所以我认为,飞行机器人未来一定会逐渐获得操作能力。它不只是去看世界,还要真正能够动手做事。HI-ARM 和我们此前探索的不同“飞行手”形态,背后都是这个思路。
(来源:受访者)
DeepTech:你们还推出了”比鸡蛋还轻“的 32 克微型飞行机器人,从 HI-ARM 到微型飞行机器人,你们似乎在不断改变飞行机器人的本体形态。未来会不会出现越来越多针对不同任务设计的“身体”?
高飞:飞行机器人的身体一定会持续分化。
飞行机器人不像地面机器人有地面提供支撑,它的重量、推力、电池、续航和体积之间高度耦合。机体越重,就需要更大的推力和电池;但本体变大以后,一些狭窄空间又进不去。所以不同场景一定会出现不同的本体形态,不太可能存在一种身体适合所有任务。
但在智能层面,我们一定希望它具备跨平台能力。否则每换一种本体,就重新研发一套算法,成本会非常高。
我们内部会把它分成“大脑”“小脑”和“群脑”。“小脑”负责运动控制和导航,需要适应不同本体;“大脑”负责任务理解、场景理解和记忆,这些能力应该尽可能跨平台复用;“群脑”处理多个机器人之间的认知和协作,也不应该过度依赖某一种特定本体。
理想状态是,不管旋翼、固定翼还是其他飞行形态,甚至不一定是飞行,底层动力学方面只需要做少量适配,上层的智能能力可以快速迁移。
图|32 克微型机器人(来源:受访者)
先让用户用起来,再让模型不断 scale
DeepTech:只看未来 3—5 年,你觉得飞行机器人最先可能落地的应用场景是什么?哪些任务是地面机器人难以替代、同时又有明确经济价值的?
高飞:我们首先会找技术和市场的交汇点。
不是只要无人机能做某个场景,我们就进去做。还要看这个场景能不能给技术带来增量,解决了 A 问题以后,能不能继续解决 B、C、D,最后让技术走向更通用的飞行智能。
如果完全只追求技术难度,那我关起门来做科研就可以了。但创业以后必须考虑真实需求,做出来的东西能不能产生价值。
具体到场景,我们还是回到团队具有优势的能力上。可以让飞行机器人不依赖人工干预、不依赖 GPS,也不依赖遥控器,进入到人不愿意去、甚至根本去不了的地方,快速获取高价值信息。
比如矿井、爆破隧道、地下电力管廊、灾后搜救等场景,往往没有卫星信号,内部地图未知,还可能有很大的高低落差或者有毒有害气体。很多时候,地面机器人也进不去,只能让小型飞行机器人自主进入。
这些场景看起来不同,但底层需要的技术其实很接近。产品真正进入这些地方以后,不仅能产生用户价值,也会积累现实环境里的高价值数据,继续推动模型迭代。
DeepTech:除了智能,飞行机器人还面临续航、可靠性和安全性这些传统工程问题。真正落地时,AI 和硬件分别扮演什么角色?
高飞:最后还是要回到用户价值。如果智能化程度很高,却只能在仿真里运行,到了真实现场飞不起来,那一切都归零了。
硬件是底座,它决定能力下限;智能决定上限。有了足够扎实的下限,智能上限每突破一点,能够打开的应用场景才会更多。
机器人出身的人会比较尊重硬件,也尊重本体的动力学特性。软件智能和硬件能力一定要共同进化,不能脱离其中一边单独做另一边。
我们也会针对真实场景做大量可靠性测试。现在部分产品的内部目标,是把严重故障率降低到千分之一以内,也就是飞行 1,000 次,最多允许出现 1 次严重故障。不管遇到什么异常,哪怕任务无法完成,飞机都要尽可能安全回来。
DeepTech:现在大模型和具身智能都在强调 scaling law。飞行智能有没有自己的 scaling law?真正需要 scale 的是什么?
高飞:通用和泛化,既是途径,也是目的。与大语言模型相比,飞行智能最大的问题,是没有现成的大规模真实世界语料。语言、图像在互联网上已经大量存在,但飞行机器人需要的数据,很多只能在真实环境里产生。
所以在启动数据飞轮以前,要先启动商业飞轮。
这是一个先有鸡还是先有蛋的问题:模型变聪明需要数据,但获得数据的前提,是用户真的愿意把产品拿到现场去用;而用户愿意用,又要求产品本身已经能够创造价值。
我们的做法,是在真实数据还不够多的时候,先利用已有的数学模型、工程方法、公开数据和预训练,让系统达到一个“能用”的状态。然后让产品进入真实场景,在使用过程中不断获得新的数据,再去提升模型的泛化能力。
所有具身智能公司其实都会面对这个问题。完全靠自己采数据,很难覆盖真实世界的分布;但如果产品一直进不了现场,也永远拿不到真正有价值的数据。
所以最后可以归纳成三个方向:训练侧 scale up,让基础模型能力不断提高;部署侧 scale down,把更强的智能放到有限的端侧算力里;场景侧 scale out,让产品进入更多过去没有见过的真实环境。
只有这三个方向一起发生,飞行智能才可能真正 scale 起来。
从单机到集群:“低空经济最缺的是大脑”
DeepTech:无人机集群是你过去很重要的一条研究线。现实中,什么场景真的需要几十台甚至几百台机器人协同?集群带来的主要是效率,还是单机做不到的新能力?
高飞:两方面都会有。第一是效率提升,尤其是在与时间和生命密切相关的场景里。比如灾害发生后,需要搜索幸存者、运输关键物资,单架无人机往往无法覆盖足够大的区域,需要多个个体共同协作。
但数量增加以后,不能各干各的,集群还必须具备弹性。所以我们一直强调分布式集群。即使其中一两架出现故障,剩下的也应该继续工作,尽最大努力完成任务。
第二,是突破单机能力的边界,这里面就涉及群体智能的涌现。一种是物理能力上的突破。比如运输大型工程物资时,可以让多架无人机协同吊运,完成单架无人机无法承担的任务。另一种是智能边界上的突破。比如执行搜索和围捕时,单架无人机可能丢失目标,但多个个体协同以后,可能形成更复杂的群体策略。
所以,集群一方面提高效率,另一方面也能在物理能力和群体智能两个层面,完成单机做不到的事情。
图|高飞团队 2022 年工作,登上 Science Robotics 封面(来源:受访者)
DeepTech:当规模从一台扩展到几十台、几百台甚至上千台时,最难的问题是什么?
高飞:最难的是系统性。几十个个体一起做事,和两三个人完全不是一个复杂度。最简单的方法当然是设置一个中心统一指挥,但中心式控制不够灵活,一旦中心节点出现问题,整个系统都可能受影响。
我们更希望形成一种自组织、分布式的群体智能:每个个体都能独立感知和决策,但又能为了同一个目标相互配合。
我很喜欢足球。比赛的时候,教练不可能实时告诉 11 名球员每一步怎么走,每个人都在自己决策,但他们为什么还能配合?因为彼此形成了默契。群体智能里很重要的一件事,就是让机器人之间也形成这种“默契”。
除此之外,还要设计它们之间的通信方式。无人机不可能把自己看到的所有信息全部传给其他个体,所以通信本身也要足够高效。某种程度上,模型智能和机间通信协议也需要一起设计、一起进化。
DeepTech:飞行会一直是微分智飞的能力边界吗?如果这套智能能够迁移到其他本体,你们是否已经做过相关验证?
高飞:我从小就对飞行很着迷。每个人可能都有今生一定要做成的事情,我甚至觉得名字也像一种宿命,所以我一定会先把飞行这件事做好。
但我们并不排斥其他平台和本体。地面、足式,甚至人形机器人,我们都会做一些研究,不过现阶段更多是把它们当作 benchmark,用来检验模型的泛化能力,而不是直接做商业化。
我们已经做过一些跨本体迁移实验。比如把算法和模型部署到轮式、足式移动平台,再加上高自由度机械臂,让机器人完成 mobile manipulation,也就是一边移动、一边操作。实验效果不错,说明模型具备一定的迁移能力。
这和我们过去做 aerial manipulation 也有关系。飞行平台本身更不稳定,机械臂操作物体产生的反作用力,会直接影响飞行器姿态,对控制稳定性、实时性和力控制的要求都很高。很多能力在这样的场景里被“逼”出来以后,再迁移到有地面支撑的平台上,反而会相对容易一些。
DeepTech:过去两年,低空经济进入一个明显的窗口期。行业更多讨论的是飞行器本体、空域和基础设施。如果未来低空经济真正进入规模化阶段,飞行智能会扮演什么角色?
高飞:飞行智能会是非常关键的一环。
现在大家讨论比较多的是基础设施和空域管控。某种程度上,这也说明系统还缺乏足够成熟的智能调度能力:如果没有办法让大量飞行器在复杂环境中安全、有序地完成任务,自然就需要更严格的管理。
但飞行器本体这边,中国整个产业链其实已经比较成熟。真正要让飞行机器人进入城市上空和各行各业,最重要的一环还是智能。
你看到一架无人机好像已经可以执行任务,但在很远的地方,往往还站着一个你看不见的人在操控。只要任务超出这个人的视野、通信范围或者操控能力,事情就做不成了。现在更多是解决了“人不会飞”的问题,但还需要人操控,任务并没有真正实现自主。
所以,在本体相对成熟的阶段,智能一旦成熟,很多场景才有可能真正 scale out。我认为,现在低空经济最缺的是智能,是它的“脑”,而不是它的“身体”。
DeepTech:那你设想中的未来低空经济,会是一套怎样的智能系统?
高飞:我认为会是“一脑多体、一脑多场景”。
同一套通用智能底座,可以部署到不同大小、不同形态的飞行器上。面对新的本体和场景,我们的最终目标是做到完全零样本泛化,或者经过代价低廉的少量适配和 fine-tune,就可以比较快地部署。
我不希望最后只是针对某一个垂直行业,做一把非常精巧、却只能敲一颗钉子的锤子。我希望有一把锤子,可以敲广阔天空中的很多颗钉子。
DeepTech:相比人形机器人等地面具身智能,飞行机器人的曝光度似乎低一些。你觉得它距离自己的“iPhone 时刻”还有多远?现在最重要的卡点是什么?
高飞:卡点还是在“脑”上,在具备泛化能力的通用智能上,而且还要同时兼顾单体智能和集群智能。
飞行机器人曝光度相对低,一个原因是行业门槛比较高。无人机本体已经很成熟,用户对硬件、安全和可靠性的期待和基本要求都很高,企业的试错成本相应就会更高。
所谓“iPhone 时刻”,应该不是某一个产品突然火了,而是出现一种和过去完全不同的产品体验,随后带动整个行业爆发。
如果一定要给一个时间,我会说 3—5 年。我们应该能看到飞行机器人在一些典型场景里真正铺开。它可能会比人形机器人稍微快一点。因为人形机器人经常被拿来和人比较效率,而飞行机器人更多是在补充人的能力。因为人没有飞行能力,它做的很多事情,本来就是人做不到或者不愿意做的。
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成







