机器人★ 评分 7.0

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu
2026年7月4日
关键词
人形机器人控制接触条件化场景重建运动追踪接触丰富交互

核心发现

  1. 接触条件化(contact conditioning)提供了一个有效的低层控制接口——仅需二元接触标签即可统一处理自由运动、地形、物体三类任务,打破了过去需要为不同场景设计专用策略的范式
  2. 场景重建(hindsight reconstruction)通过从纯运动学运动反演场景交互图并合成可行资产,巧妙解决了配对数据稀缺问题,相比OmniRetarget等既有重定向方法提升了物体操纵成功率(95% vs 85%),但本质上是逆向工程而非前向优化
  3. 全局状态追踪对接触任务至关重要——加入全局根位置/速度后,地形任务成功率从45%提升至100%,物体任务从20%提升至95%,但这是对既知事实的重新确认
  4. 接触标签的作用因任务而异——物体操纵中必不可少(无标签0%成功),但地形任务中标签主要是简化训练而非改变学习本质(训练时100% vs 无标签时85%),说明政策能够通过自学习保留部分平衡能力

实验规模

训练数据:融合AMASS、OMOMO、Bones、Lafan共7.5小时运动数据,通过场景重建生成配对的地形/物体资产。评估:MuJoCo仿真环境中对4类任务(自由空间、地形、物体、坐下)各20个未见序列的追踪,对标SONIC及多种消融变体(无标签、无脚部接触、局部追踪)。真实部署:Unitree G1人形机器人搭载i5-13200H+RTX 3050,通过SuperOdometry+盆腔IMU状态估计,对OptiTrack动捕进行10次实验验证,位置误差0.032m、朝向误差0.018rad、成功率80%。

局限性

场景重建对高质量运动学数据的强依赖性制约了其自动化程度——真实视频或生成式模型产生的动作常伴随足滑等问题,会直接破坏场景交互图构建。训练中使用"魔法力"强制物体跟随轨迹与实际机器人物理不符,存在训练-部署不匹配风险。状态估计方案对Unitree G1的硬件配置(盆腔IMU+LiDAR)有较强定制性,迁移至其他人形机器人平台需重新调参。

Paper ID: 2606.27581