机器人★ 评分 5.7

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou
2026年7月4日
关键词
视频扩散模型物理对齐机器人操作轨迹监督语义关系一致性

核心发现

  1. 视频生成模型中的物理违反(物体穿透、轨迹不连续、接触破裂)源于两个因素:移动物体变形和实体间的非物理时空相关性,尤其在接触阶段——问题诊断准确但非原创,PhysisForcing的贡献在系统化解决方案而非发现新病因。
  2. 分层物理约束的设计(像素级MSE监督+语义级token相似度对齐)在R-Bench、PAI-Bench、EZS-Bench上均有改进(+9.2%、+4.1%、+0.8%相对基础模型),但幅度中等——核心贡献来自与强微调基线的对比(+3.7%相对vanilla finetuning),纯PhysicsForcing额外收益仅2-3个百分点。
  3. 下游任务中WorldArena闭环成功率从16%→24%(+50%相对值),但绝对成功率极低且不均匀(某些任务下降),RoboTwin策略学习仅+4.6%,表明物理对齐的收益在复杂推理任务中递减;方法高度依赖于训练域分布。
  4. 消融实验系统完整(验证两损失互补性、区域焦点、层深度选择),但与最强竞品(ABot-PhysWorld)缺乏相同训练数据和基线的直接对标;零样本泛化能力(EZS-Bench+0.8%)接近噪声,暴露泛化脆弱性。

实验规模

训练数据:RoVid-X数据集中筛选的50万高质量机器人视频(从400万原始样本过滤)。骨干模型:Wan2.2-I2V-A14B(14B参数,MoE双专家)、Wan2.2-TI2V-5B(5B单专家)、Cosmos3-Nano(16B MoT)。评估基准:R-Bench 650样本(任务×具身维度)、PAI-Bench机器人域174样本、EZS-Bench 196样本(训练无关零样本)。消融实验:4个维度(损失分量、区域焦点、层深度选择、训练动态曲线)。下游评估:WorldArena行动规划(2任务×模型)、RoboTwin 2.0策略学习(6任务×200 rollouts)。训练配置:Wan2.2系列20K步批量128、学习率1e-5;Cosmos3-Nano在720p直接训练,使用LoRA。

局限性

方法论上,PhysisForcing本质是现有工具的工程堆砌(CoTracker3点追踪 + Depth-Anything-V2深度估计 + V-JEPA冻结编码器),缺乏新颖的算法或理论贡献,距离

Paper ID: 2606.28128