机器人★ 评分 6.5
LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
Qinhong Zhou, Chuang Gan, Anoop Cherian
2026年7月4日
关键词
多智能体通信协作行为法则提取Embodied AI监督微调失败驱动学习
核心发现
- 失败驱动法则提取具有鲁棒性:从失败轨迹中系统分析失败原因并聚合为5条高层法则,在三个随机种子实验中语义保持一致(success rate标准差仅0.012),证明法则提取的可重复性。
- 参数级学习优于推理时检索:Ablation实验显示SFT后的模型相比在线RAG提升5%,说明法则必须通过参数微调才能被模型内化而非仅在推理时调用。
- 小模型超越大模型现象揭示方法的特异性:Qwen-3-14B (0.74) 超越LLaMA-3.1-70B + 所有baseline (0.73);LLaMA-8B虽低于其ReAct baseline但显著超越所有其他communicative baseline,表明方法主要补偿小模型能力缺陷。
- 法则的可控性被验证:对照干预实验证明替换法则可改变模型行为(send message概率从92%→19%),且人工编辑法则后模型可靠遵循,实现了可解释的对齐机制。
- 新基准PARTNR-Dialog实现2000倍数据量级提升:相比TDW-MAT的24个训练样本,新基准提供2000训练+1000验证样本,使learning-based多智能体方法的验证成为可能。
实验规模
在PARTNR-Dialog(2000训练+1000验证,基于Habitat 3.0)和TDW-MAT两个embodied多智能体任务上进行评估。使用4个LLM骨干(LLaMA-3.1-8B/70B、Gemma-3-12B、Qwen-3-14B)进行跨模型验证。消融实验包括:管道级ablation(移除SFT、法则、过滤操作、手工法则)、法则数量敏感性分析(K=3/5/10)、稳定性验证(3个随机种子、计算标准差与一致性)、对照法则干预实验(100个随机查询样本)、基线对比(ReAct、RoCo、CoELA、CommPARTNR共4个baseline)。评估时间成本为A100 GPU 4小时(8B模型)。
局限性
方法在小模型上的改进显著(8B: +7%)而在强模型上边际(70B: +2%),反映出LLawCo主要补偿弱模型能力缺陷而非通用协作优化,限制了其在强模型上的适用价值。法则提取依赖训练集failure分布,跨任务泛化能力未被验证(论文缺乏将PARTNR-Dialog学到的法则迁移到TDW-MAT的实验)。虽然宣称"自主学习",但K=5、failure分析prompt等关键设计仍由人工指定,且缺乏human evaluation验证自动提取的法则是否满足actionable、general等标准。