机器人★ 评分 5.5

Regularized Reward-Punishment Reinforcement Learning

Jiexin Wang, Eiji Uchibe
2026年7月4日
关键词
奖励-惩罚强化学习KL耦合策略机器人导航动态行为先验多目标协调

核心发现

  1. KCPR框架用动态学到的伴侣策略替代固定先验,使奖励寻求和惩罚规避两个子系统通过KL正则化耦合在一起,网格世界实验展示了通过改变η可连续混合两个动机的行为,但理论上缺乏收敛性和不动点存在性的形式化证明
  2. 伴侣先验软化机制(Eq.7)通过与均匀分布插值防止过度自信的先验过早冻结价值传播,消融实验表明ε∈[0.3,0.6]显著改善学习稳定性,但这本质上是稳定性补丁而非核心创新
  3. 分离式回放缓冲按判别器D分配经验到正负缓冲,改善强KL耦合下的学习平衡,该方案完全继承自softDMP,仅在新框架下重新验证
  4. Gazebo导航实验中klDMP相比softDMP显示更稳定的安全-效率权衡(碰撞率方差更小),但5次运行缺乏统计检验,klDMP超参通过新的参数扫描优化而基线采用固定配置,存在隐性超参优化偏差
  5. 实验仅限离散动作空间的视觉导航任务,无连续控制验证,泛化性未知,理论框架启发式而非严格,缺乏与Expected SARSA和多任务学习中类似思想的清晰区分

实验规模

网格世界实验:9×9 U迷宫和36×19三房间迷宫上进行表格学习(klMP/klQVI),独立运行5次,超参扫描η∈{100,1000,10000}和ε∈{0,0.3,0.6};Gazebo模拟导航:TurtleBot3在三个复杂度递增的迷宫中测试,输入为RGB图像+LiDAR扫描,共享编码器配分离的价值/策略头(4个输出),对比DQN、SQL、softDMP,独立运行5次,报告轨迹长度和碰撞率;深度网络采用标准actor-critic架构,价值头直接梯度回传,策略头梯度限制在共享层以上;缺少标准RL基准(Atari/Mujoco)验证

局限性

理论不完备:缺乏KCSO收敛性和不动点存在性的形式化证明,Eq.(2)中π^+和π^-的循环定义在什么条件下保证唯一解?;实验规模和统计严谨性不足:仅5次独立运行无置信区间/显著性检验,klDMP通过参数扫描得到最优超参而基线采用原论文固定配置,造成不公平的超参优化偏差;方法创新边界有限:动态先验替换在多任务学习中已有先例,软化机制仅是均匀分布插值,分离缓冲完全继承softDMP,仅在离散视觉导航验证,无连续控制和标准基准的结果

Paper ID: 2606.28152