机器人★ 评分 6.0

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

Shiqiang Gong
2026年7月4日
关键词
扩散规划离线强化学习分布式价值批评风险敏感决策条件价值风险(CVaR)

核心发现

  1. 将分布式RL的分位数回归与引导扩散采样结合,设计状态轨迹扩散规划器+逆动力学解码器+分布式价值批评器的三模块架构,在去噪过程中使用CVaR/VaR梯度指导轨迹生成——核心创新是让扩散模型显式建模回报分布的尾部风险,解决传统扩散规划器风险中立的痛点。
  2. 通过改变推理时风险参数α实现单一模型下的风险厌恶/风险中立/风险寻求三种行为灵活切换,无需重新训练——这相比固定风险偏好方法降低部署成本,但实际收益相比固定策略的成本效益分析缺失。
  3. 在D4RL风险敏感基准(Half-Cheetah、Walker-2D、Hopper三环境)和机器人导航任务上超越SOTA基线(CVaR₀.₁和均值指标均最优,导航任务零违规),但与最强基线UDAC的性能差异常在标差范围内(如Half-Cheetah Expert: 793±125 vs UDAC 732±104),缺乏统计显著性检验,改进的统计学可靠性存疑。

实验规模

在D4RL基准的6个配置(Half-Cheetah/Walker-2D/Hopper各3个数据质量等级:Medium/Expert/Mixed)和2个机器人导航任务(Risky PointMass、Risky Ant)上验证。每个任务运行100个测试episode,报告5个随机种子的均值±标差。模型配置:Transformer 2层(隐层256维)、DDIM采样20步、1M训练迭代、batch size 256。对比6个强基线(CQL、Diffusion-QL、OWCPG、ORAAC、CODAC、UDAC),消融分析通过在Half-Cheetah上变化CVaR/VaR的α参数进行。但缺少:推理计算开销定量对比、不同分位数数量N的敏感性分析、高维视觉观测场景验证。

局限性

方法创新层面:核心技术(扩散采样、分位数回归、CVaR引导)均为既有方法,论文主要贡献是工程级融合而非算法突破,创新度受限。实验有效性层面:D4RL属低维连续控制(状态维12-17),与最强基线UDAC的性能差异常在标差范围内且缺乏统计显著性检验;高维或视觉观测场景未验证。可部署性层面:三模块架构增加推理成本,CVaR梯度计算的额外开销未量化;'推理时可调风险'相比固定策略的实际收益-成本分析缺失。

Paper ID: 2606.27766