返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

机器人强化学习

从宇树机器人的丝滑舞蹈到波士顿动力Atlas的跑酷后空翻,从Figure的协作能力到云深处机器狗的山地越野,强化学习(RL)正成为机器人算法的核心驱动力。申万宏源认为,基于机器人动作特征可反推出底层AI算法——运动丝滑/柔顺意味着RL算法解决了高次项问题;协作性强意味着分层强化学习(HRL)发挥作用;高速场景意味着RL+低延迟MPC+海量数据充分训练。机器人强化学习正从实验室走向大规模工业部署。

动作丝滑→强化学习(RL)弥补高次项

机器人的运动丝滑、柔顺,背后通常是强化学习(RL)算法在发挥作用。传统控制算法(如PID、CTC)依赖拉格朗日/牛顿-欧拉动力学模型,高次项误差导致动作抖动和延迟卡顿。强化学习直接学习非线性映射,绕过精确建模要求,通过奖励函数设计引导机器人学会平滑运动。宇树科技在GitHub上开源了PPO算法和Sim2Real迁移代码,通过仿真环境训练控制策略并迁移到真实机器人(Go2/G1/H1)。UCSD在ICRA2023的《High-Fidelity Motor Control for Quadruped Robots via Reinforcement Learning》也借鉴了宇树机器狗进行实测验证。

协作性强→分层强化学习(HRL)+语义驱动

机器人展示协作性强、能与人类互动时,通常采用分层强化学习(HRL)或语义驱动算法(如VLM模型)。波士顿动力Atlas采用HRL+MPC框架,上层统筹规划多任务协调,下层精确执行动作。Figure的VLA模型Helix通过“系统1+系统2”架构实现语义理解和高频动作控制的协同。智元机器人自研AgiBot Digital World仿真框架生成多模态数据,支持多任务协作。分层强化学习将复杂任务分解为子任务层和动作层,上层语义理解结合下层RL控制,使机器人与人类协作更加自然。

高速场景→RL+低延迟MPC+海量数据

机器人展示高速运动(如跑酷、跳跃、快速避障)时,通常需要强化学习配合低延迟MPC(模型预测控制)和充分的数据训练。MPC通过动力学模型预测未来状态并优化控制输入,RL训练奖励函数鼓励大幅度动作和爆发性动作。宇树H1和G1在舞蹈表演中展现高频响应,云深处机器狗在山地场景中实现动态避障,均依赖RL+MPC的协同。英伟达与加州大学研究人员合作发布的NaVILA(视觉-语言-动作模型)使用宇树Go2和G1进行实测,验证了RL+大模型的可行性。

算法失灵判断:震颤/抖动/死循环→PID/MPC问题

基于机器人动作也可推测算法失灵原因。震颤/抖动→PID控制积分饱和或微分增益过高,或滑模控制(SMC)未建模动态。延迟卡顿→动力学模型误差需频繁修正。局部死循环→局部规划算法代价函数权重失衡。能耗异常→计算误差需重复迭代优化。速度快慢则可判断RL训练是否充分——速度快说明训练充分+奖励机制合理;速度慢可能意味着训练不足或奖励机制不合理,也可能控制算法太复杂导致高次项误差大。
表:从机器人动作反推底层AI算法
机器人动作特征推测算法原理典型公司
运动丝滑/柔顺强化学习(RL)弥补高次项误差宇树、云深处
协作性强分层强化学习(HRL)+语义驱动多任务协调波士顿动力、Figure
人机互动/创造力VLA模型视觉-语言-动作端到端Figure、智元
高速场景/爆发力RL+低延迟MPC+海量数据奖励幅度+实时反馈宇树、波士顿动力
幅度大/抗击打强化学习(RL)奖励大幅度动作宇树
点击阅读报告原文: 计算机行业机器人系列深度报告之二十三:机器人算法硬件遇上现代AI算法-250304(29页)
相关报告