机器人★ 评分 5.2

CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation

Wenqi Ge, Junde Guo, Zhen Fu, Shunpeng Yang, Jiayu Chen, Hua Chen
2026年7月4日
关键词
人型机器人全身控制对抗运动先验运动数据解耦强化学习与动作模仿遥操作

核心发现

  1. 运动数据源的角色分离是关键——上身采用完整AMASS语料库保留多样操纵,下身用精选行走/蹲起片段通过对抗运动先验提供稳定的命令响应,而非简单过滤整体数据集,避免丢失有效上身动作。表II消融表明用随机关节目标替代AMASS上身数据时,末端执行器误差从42.91mm剧增至62.32mm,加速度从28.8增至48.2 rad/s²。
  2. 多评论家架构(为运动跟踪、操纵跟踪、风格奖励各分独立价值函数)通过组内GAE与minibatch归一化显式处理目标冲突,单评论家基线下角速度误差增加至0.199 rad/s(vs 0.1825),末端位置误差至55.49mm(vs 42.91mm),图5训练曲线证实多评论家收敛更快。
  3. 双AMP判别器(行走/蹲起分离)比单一混合判别器更好地保持下身风格——单判别器使DTW距离从0.452增至0.615 rad,加速度95百分位从28.8至35.1 rad/s²;完全移除AMP导致DTW爆炸至1.413 rad并出现频繁站立违规。
  4. 师生蒸馏框架结合RL与行动匹配BC项(公式8)是从手部位置命令学习全身协调的必要条件——单阶段策略的末端误差从42.91mm飙升至173.2mm,而蒸馏后学生策略仅需VR手柄信号实现遥操作。
  5. 统一策略内隐含学到上下身耦合(图6):腰部俯仰与手部距离自动关联,因为AMASS数据编码了人类运动中的这种协调模式,而非显式命令。

实验规模

模拟:IsaacLab中31自由度LimX Oli人型机器人,AMASS上身全量数据(85%/15%分割),精选约10个高质量行走和蹲起下身片段,命令范围v_x∈[-0.5,1.0]m/s、ω_yaw∈[-1.2,1.2]rad/s、h∈[0.17,0.9]m;对比3个基线(HOVER*、FALCON*、HOMIE*,均在该机器人上重新实现)、5个消融变体;报告成功率、关键体位置/方向误差、速度/高度误差、DTW距离、加速度95百分位。真实机器人:LimX Oli + Meta Quest VR头盔遥操作,5类真实任务场景(拾取-放置、开门、敲鼓、瓶盖旋转、零件装配),定性评估与图6时间序列分析,缺乏量化指标。

局限性

框架高度依赖手工标注的精选下身片段,扩展到新运动类型需重新数据收集与标注,可扩展性受限。真实机器人实验完全缺乏量化数据(任务成功率、完成时间、精度),仅图6单任务定性展示,无法科学量化模拟-现实转移的可靠程度。方法在单一平台(LimX Oli)验证,跨平台泛化与AMASS数据在异形机器人上的适配性未检验;基线为作者重实现版本,无法完全确保原论文超参的忠实复现。

Paper ID: 2606.27676