机器人★ 评分 6.3

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience

Raymond Yu, William Huey, Mustafa Mukadam, Anusha Nagabandi, Abhishek Gupta
2026年7月4日
关键词
支撑集约束策略改进灵巧多指操作流引导强化学习仿真-现实转移无蒸馏部署

核心发现

  1. 正式定义了非同域策略改进问题,通过玩具例子揭示无约束RL(奖励黑客)、分布约束RL(保留低效行为)与支撑集约束(精准改进)之间的权衡关系
  2. 提出SCORE框架:冻结真实基础策略,仅在流匹配策略的隐空间学习引导策略,通过DSRL/RFS实现支撑集约束,无需蒸馏或真实微调即可直接部署
  3. 在8个真实机器人灵巧操作任务上验证:平均成功率从37.8%提升至89.9%(vs基线59.5%),完成时间提升36.8%,但在分布外环境(新物体、干扰物)上性能陡降,揭示方法对基础策略覆盖的极端依赖

实验规模

真实数据:890条真实世界演示(每任务90-170条),涵盖8个多指灵巧操作任务(Franka FR3+LEAP Hand)。仿真配置:4096个并行IsaacLab环境,从实际扫描构建场景,域随机化涵盖物体尺度/质量/摩擦/位置。基线对比:FPO、RialTo、Residual-RL、SCORE-DSRL共5种方法。真实评估:每任务8-24个试验。消融验证:非对称演员-评论家、人工失败恢复、数据多样性影响、多任务先验等

局限性

(1)技术创新程度有限:支撑集约束和流引导皆为既有概念的应用迁移,相比基线的主要优势来自非对称评论家等工程选择而非约束机制本身。(2)泛化能力受限:Section 5.2适配实验表明,在分布外环境下(新物体、干扰物)性能大幅下降,折射出方法对基础策略数据覆盖的极端敏感性。(3)理论-实践鸿沟:Appendix E的形式化分析基于三个假设,其在接触丰富的动力学不匹配场景中的可验证性存疑,特别是Assumption E.1在真实机器人系统中难以满足

Paper ID: 2606.27475