


Wang Y F, Li H C, Li M Y, et al. Functional grasping of floating tools in zero-gravity space using reinforcement learning for dexterous robotic hands. Sci China Tech Sci, 2026, 69(6): 1620403, https://doi.org/10.1007/s11431-026-3327-y
作者:王一帆,李厚成,李明洋,徐拴锋,刘乃龙,程龙
单位:中国科学院自动化研究所多模态人工智能系统全国重点实验室;中国科学院大学人工智能学院;北京控制工程研究所空间智能控制技术全国重点实验室
关键词:强化学习、抓取、机械灵巧手
在空间环境中,对具有初始线速度/角速度的工具进行功能性抓取面临着重大挑战。与静态桌面抓取不同,在静态桌面抓取中,物体的运动可以通过表面接触来限制,而没有重力约束时,轻微的碰撞即可将工具推开,从而导致频繁的抓取失败。此外,与人手相比,自由度较低的机器人手很难复制出类似人类的功能性抓握姿态。
探索机械灵巧手空间漂浮工具功能性抓取方法,是后续空间场景下自动化抓取,操作相应工具的前提。中国科学院大学与北京控制工程研究所的王一帆,李厚成,李明洋,徐拴锋,刘乃龙,程龙等人在 Science China Technological Sciences 2026年第6期发表了题为“Functional Grasping of Floating Tools in Zero-Gravity Space Using Reinforcement Learning for Dexterous Robotic Hands”的论文,提出了根据人手抓取数据,利用强化学习使灵巧手能够在模拟中自主探索可行抓握姿势的方法。该方法构建了姿态探索+接近抓取训练框架,通过人手启发式奖励函数设计,在Isaac Gym仿真环境中使用LSTM-PPO策略,成功实现了对具有一定初始线速度/角速度的浮动工具的功能性抓取。
这项工作的突出特点可以概括为三个方面:(1)采用了两阶段训练框架,将人类引导的抓取姿势探索与动态工具方法和抓取相结合。(2)设计了一种受人类手部姿势启发的启发式奖励,使机器人手能够通过强化学习任务自主探索类似人类的功能性抓取姿势。总结了机械手动态目标捕捉的接近模式,构建了轴向对齐奖励函数来实现动态漂浮物体的捕捉。(3)利用LSTM-PPO方法进行强化学习,并利用Isaac Gym的并行计算来保证上述任务的模拟执行。
研究搭建的整体训练框架分为人类引导的手势探索和动态工具接近与抓取两个核心阶段,两个阶段共享统一的奖励函数,仅在场景初始化规则上有所区分(图1)。手势探索阶段将工具直接初始化在目标相对位姿,以OakInk人手抓取数据集为参考,把人手的掌指相对位置、关节角度等特征映射到机械手对应关节,让自由度较低的机械手模仿人类的全自由度抓握姿态,探索适配工具功能的可行抓取姿势;动态抓取阶段则将工具在机械臂不同距离处随机生成,并赋予指定初始线速度和角速度,让机械手学习目标追踪、接近和动态捕捉的完整策略。
训练过程中,手势探索场景的数量会按照模拟退火策略逐步减少,动态抓取场景占比逐步提升,实现机械手从 “静态学姿势” 到 “动态练抓取” 的平稳过渡。

图1 两阶段训练框架
为了让机械手探索出类人的功能性抓取姿势并实现对浮动工具的稳定捕捉,研究从人手抓取的运动规律出发,设计了一套分层的启发式奖励函数,涵盖手势探索奖励和接近抓取奖励两大模块,多维度约束机械手的动作行为:
1
手势探索奖励
包含手势接近奖励、掌 / 指朝向奖励、旋转奖励。手势接近奖励引导机械手关节角度逐步靠近人手目标姿态,而非严格复刻,适配机械手的机械结构特性;掌 / 指朝向奖励确保工具的功能部件处于掌心侧,且各指尖相对功能部件的位置符合抓取需求(如食指对准工具按钮,如图2所示);旋转奖励则引导机械手以正确的相对旋转姿态抓取工具,可根据工具的旋转对称性灵活选择约束轴。

图2 抓取姿态示意
其中,指尖朝向奖励不要求指尖到达对应位姿,而是仅约束指尖相对于相关零件的朝向,保证探索的灵活性。
2
接近抓取奖励
包含距离奖励、速度方向奖励、目标位姿奖励。距离奖励同时惩罚工具与目标位姿、掌心的距离,鼓励工具向掌心和目标位置双靠近;速度方向奖励约束机械手从掌心侧追踪浮动工具,避免因接触方向错误将工具推开;目标位姿奖励则引导机械手将抓取后的工具移动至指定位置和旋转角度,完成功能性抓取的最终目标。
整体奖励函数通过权重调节各模块占比,且仅当工具功能部件与掌心的距离低于阈值时,才激活手势关节角度奖励,确保机械手先完成接近,再精细化调整抓取姿势。
针对浮动工具具有初始速度、运动状态随时间变化的特点,研究选用LSTM-PPO作为强化学习策略网络,将LSTM的时序信息处理能力与PPO的稳定策略优化优势相结合(图3)。

图3 训练网络框架
网络的动作空间包含机械手主动自由度和机械臂主动自由度的关节角度,观测空间则涵盖目标手势关节角度、掌指位姿、工具及功能部件相对掌心的位姿等 97+7n 维特征(n为零件数量),且所有观测变量均做裁剪处理,避免极端值影响训练稳定性。策略网络通过 LSTM 层提取工具运动的时序特征,再经 MLP 层处理后输出动作,评论家网络则采用与演员网络相同的架构,输出状态价值函数。网络各层采用 ELU 激活函数,动作从正态分布中采样,结合 PD 控制实现对机器人关节的控制。
消融实验结果显示,只有同时结合两阶段手势探索和所设计的手势奖励,机械手才能达到 56.23%±0.30% 的平均抓取成功率;缺少手势探索时,机械手易绕着工具运动而不敢接近,避免因碰撞将工具推开;缺少手势奖励时,机械手手指无法形成稳定抓握姿态(图4),工具易滑脱,充分证明了双阶段框架和启发式奖励函数的核心作用。

图4 运动平滑性评分结果
图5展示了各类观测构成对探索奖励积累的影响。在全部观测已知的情况下,奖励累积较稳定。同时可供性零件姿态对于策略探索具有重要性,它可保证在探索过程中正确找到对应抓取位置。仅有物体位姿情况下,随着接近探索阶段的占比增大,策略由于失败次数累积,后续奖励累积难以增大。同时指尖位姿的获取也是保证奖励稳定累积的关键,这也与指尖朝向奖励的存在有关。

图5 不同观测下奖励累积曲线
将研究方法与逆运动学 + RL、纯 MLP 的 PPO两种基线方法对比,结果显示:逆运动学 + RL 方法因易碰撞工具导致成功率仅 22.31%±0.14%;纯 MLP 的 PPO 方法无法有效处理工具运动的时序信息,难以完成稳定抓取。而 LSTM-PPO 策略凭借时序特征提取能力,在动态抓取中表现出显著优势。
研究绘制了成功率 - 速度热力图(图 6),定量分析了工具初始线速度和角速度对抓取效果的影响:在低速度区间,抓取成功率最高可达 96.62%;随着线速度和角速度的提升,成功率呈明显下降趋势,在速度边界(0.1m/s、0.1rad/s)处,成功率降至 2.00%,明确了该方法在零重力动态抓取中的操作边界。

图6 速度与成功率的关系
同时,研究将方法应用于螺丝刀、电钻等不同工具的抓取任务,螺丝刀的抓取成功率达到 48.2%±0.10%,证明该方法基于功能部件的奖励设计和策略架构具备跨工具几何形状的泛化能力;而电钻抓取失败则源于机械手拇指开合度有限,无法包裹电钻手柄,为后续机械手的机械结构优化提供了方向,图7给出了抓取成功案例。图8展示了几种较难抓取的情况。如工具距离机械臂太近时,机械臂运动极易击飞物体。

图7 几种抓取成功案例

图8 几种较难成功的情况
研究将人类引导的强化学习框架应用于零重力环境下浮动工具的功能性抓取,突破了传统静态抓取方法在空间动态场景中的局限,为空间机器人的自动化操作提供了新的技术路径。研究提出的双阶段训练框架、人手启发式奖励函数和 LSTM-PPO 策略,不仅实现了零重力下浮动工具的稳定抓取,还为低自由度机械手模仿人类功能性抓握姿态提供了可行方案。
当然,研究目前仍存在一定局限性:实验仅在仿真环境中开展,尚未进行物理实验验证;抓取对象以简单几何形状工具为主,对复杂结构工具的抓取能力有待提升;整体抓取成功率仍有进一步优化的空间。
未来,研究团队将从三方面展开后续工作:一是开展物理实验,将仿真训练的策略迁移至实际空间机械手上,验证方法在真实零重力环境中的有效性;二是拓展抓取对象的范围,针对复杂几何形状、多功能部件的工具优化奖励函数和策略网络;三是优化机械手的机械结构,提升关节自由度和操作灵活性,同时设计分阶段的奖励和策略,将抓取任务拆解为接近、调整、抓取等子步骤,进一步提升动态抓取的稳定性和成功率。







