机器人★ 评分 6.5
Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor
Yifan Zhai, Elia Raimondi, Yunfan Ren, Ismail Geles, Yannick Armati, Jiaxu Xing, Davide Scaramuzza
2026年7月4日
关键词
混合模拟器绳悬载荷强化学习控制四旋翼操纵Sim-to-Real转移
核心发现
- 混合模拟器通过单一力矩通道耦合四旋翼与绳-载荷动力学,保留高保真度同时无需重新辨识(系统辨识复用性)——这是突破的关键架构创新。
- 端到端RL策略相比TO+MPC基线实现着陆误差降低50%(2.0m目标:0.105m vs 0.167m)、投掷时间缩短30%(1.154s vs 1.605s),且在硬件上零样本成功,而基线在完美仿真中仍受释放速度误差(最大14.3cm/s)限制。
- plan-track分离是基线失效的根本原因:轨迹跟踪误差直接放大为着陆误差(表IV显示速度误差0.4→14.3cm/s对应着陆误差0.03→0.41m的线性映射)。
- 消融实验(表V)证明每个模拟器模块(气动、电机、低级控制器、柔性绳)都不可或缺——移除任一导致着陆误差增加2.4-3.7倍,确认混合模拟器是sim-to-real成功的必要条件。
- 框架泛化性良好:状态观测与视觉观测策略性能相当(表VI),2.5m训练外目标投掷成功,证明学到的控制策略具有鲁棒性。
实验规模
硬件平台:自研四旋翼(质量0.21kg、臂长19.4cm、推重比6.8),配3D打印释放机制和33cm绳索。投掷试验:1.5m/2.0m/2.5m三个距离,每个距离10次投掷(共30次真硬件测试),记录着陆位置和投掷时间。基线对比:TO+MPC使用同一CTBR接口、刚性球摆模型,在仿真器中运行(完美模型)。消融研究:4个变量(无气动、无电机模型、简化控制器、刚性绳),每个变量5次投掷。训练配置:PPO算法,单RTX5090 GPU,2×10^8环境步,1小时收敛。
局限性
首先,实验场景受限于静止地面目标和单一载荷(网球),真实搜救/配送中的动目标、多形态载荷、复杂环境风力等因素未涉及,限制了实用价值。其次,基线对比不完全对称——RL在硬件上运行(含观测噪声和未建模动力学),而TO+MPC在完美仿真中运行;理想的对比应两者都在相同条件下测试,以更清晰地判别方法创新的本质优势。第三,域随机化范围(质量±5%、绳长±6%、初始角度±15°)的充分性缺乏系统论证,环境变化(温度、气压、风力)的适应机制也未建立,这影响模型部署的可靠性边界。