从宇树机器人的丝滑舞蹈到波士顿动力Atlas的跑酷后空翻,从Figure的协作能力到云深处机器狗的山地越野,强化学习(RL)正成为机器人算法的核心驱动力。申万宏源认为,基于机器人动作特征可反推出底层AI算法——运动丝滑/柔顺意味着RL算法解决了高次项问题;协作性强意味着分层强化学习(HRL)发挥作用;高速场景意味着RL+低延迟MPC+海量数据充分训练。机器人强化学习正从实验室走向大规模工业部署。
动作丝滑→强化学习(RL)弥补高次项
机器人的运动丝滑、柔顺,背后通常是强化学习(RL)算法在发挥作用。传统控制算法(如PID、CTC)依赖拉格朗日/牛顿-欧拉动力学模型,高次项误差导致动作抖动和延迟卡顿。强化学习直接学习非线性映射,绕过精确建模要求,通过奖励函数设计引导机器人学会平滑运动。宇树科技在GitHub上开源了PPO算法和Sim2Real迁移代码,通过仿真环境训练控制策略并迁移到真实机器人(Go2/G1/H1)。UCSD在ICRA2023的《High-Fidelity Motor Control for Quadruped Robots via Reinforcement Learning》也借鉴了宇树机器狗进行实测验证。
协作性强→分层强化学习(HRL)+语义驱动
机器人展示协作性强、能与人类互动时,通常采用分层强化学习(HRL)或语义驱动算法(如VLM模型)。波士顿动力Atlas采用HRL+MPC框架,上层统筹规划多任务协调,下层精确执行动作。Figure的VLA模型Helix通过“系统1+系统2”架构实现语义理解和高频动作控制的协同。智元机器人自研AgiBot Digital World仿真框架生成多模态数据,支持多任务协作。分层强化学习将复杂任务分解为子任务层和动作层,上层语义理解结合下层RL控制,使机器人与人类协作更加自然。
高速场景→RL+低延迟MPC+海量数据
机器人展示高速运动(如跑酷、跳跃、快速避障)时,通常需要强化学习配合低延迟MPC(模型预测控制)和充分的数据训练。MPC通过动力学模型预测未来状态并优化控制输入,RL训练奖励函数鼓励大幅度动作和爆发性动作。宇树H1和G1在舞蹈表演中展现高频响应,云深处机器狗在山地场景中实现动态避障,均依赖RL+MPC的协同。英伟达与加州大学研究人员合作发布的NaVILA(视觉-语言-动作模型)使用宇树Go2和G1进行实测,验证了RL+大模型的可行性。
算法失灵判断:震颤/抖动/死循环→PID/MPC问题
基于机器人动作也可推测算法失灵原因。震颤/抖动→PID控制积分饱和或微分增益过高,或滑模控制(SMC)未建模动态。延迟卡顿→动力学模型误差需频繁修正。局部死循环→局部规划算法代价函数权重失衡。能耗异常→计算误差需重复迭代优化。速度快慢则可判断RL训练是否充分——速度快说明训练充分+奖励机制合理;速度慢可能意味着训练不足或奖励机制不合理,也可能控制算法太复杂导致高次项误差大。
表:从机器人动作反推底层AI算法| 机器人动作特征 | 推测算法 | 原理 | 典型公司 |
|---|
| 运动丝滑/柔顺 | 强化学习(RL) | 弥补高次项误差 | 宇树、云深处 |
| 协作性强 | 分层强化学习(HRL)+语义驱动 | 多任务协调 | 波士顿动力、Figure |
| 人机互动/创造力 | VLA模型 | 视觉-语言-动作端到端 | Figure、智元 |
| 高速场景/爆发力 | RL+低延迟MPC+海量数据 | 奖励幅度+实时反馈 | 宇树、波士顿动力 |
| 幅度大/抗击打 | 强化学习(RL) | 奖励大幅度动作 | 宇树 |