智能体系统★ 评分 7.2
Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy
Ruiyu Zhang, Lin Nie, Xin Zhao
2026年7月4日
关键词
度量聚合发散智能体基础模型多目标进化算法政策优化管道可复现性
核心发现
- 度量聚合发散(MAD)是管道架构级隐患而非分析选择:当优化器、竞赛评估、推断阶段独立重实现聚合函数时,同一指标可产生不同排序,导致64.2%的champion不一致率。逻辑支撑:每个阶段内部自洽,但cross-stage比对时失效,反映流程模块化的自然结果。
- 聚合函数距离(而非随机噪声)驱动发散:受控实验(EA-3)显示Spearman相关距离δ解释的翻转方差4.1倍于噪声τ,意味着增加episode数无法缓解此问题。逻辑支撑:结构性问题无法通过数据扩充消除。
- 真实政策后果量化:EpidemiOptim真实代码审查+300种子复现展示83%的情况推荐错策略,welfare gap 2.19单位,Gini不平等增0.050;Lake Problem DPS工作流显示契约路径在159/167不同状态优胜(p<10⁻¹⁸)。逻辑支撑:不是假设的问题而是已发表系统中的实测缺陷。
- Scope condition边界清晰:单调轨迹下MAD不显现(Wolf-Sheep验证);非单调+非commensurable聚合对(entropy-mean, ρ=0.37)激发高翻转率。逻辑支撑:理论有边界条件而非全面性主张,提高科学可信度。
- 度量契约解决方案工程可行:单一callable在管道初始化注册、dispatch time 31-39ms相比独立实现2.2-5.0s快134倍(W=8);3%运行时开销;可增量部署。逻辑支撑:consistency与efficiency不矛盾,实际可采纳。
实验规模
多层次实验验证:(1)受控机制研究(EA-2/3/7):50-100 runs/条件在MockArena/Schelling/Wolf-Sheep/Boltzmann四个ABM上进行,τ参数扫描6个水平;(2)政策翻转实验(EA-1):300独立种子,2基因生态模型,8场景×5 episodes;(3)真实代码复现(EA-11):500次NSGA-II复现EpidemiOptim结构(pop=40, ngen=25);(4)并行管道压力测试(EA-11-C):100复现×2/4/8工作进程×6聚合函数对;(5)Lake Problem DPS存档重放:same-candidate-set replay在1000世界状态下对比已发表路径vs契约路径。所有主要结论(EA-1/2/3/7)均应用Holm-Bonferroni FWE修正,α=0.05。
局限性
- 域泛化性受限:实验仅覆盖流行病/生态/水资源三类应用,交通、能源、城市规划等ABM+MOEA领域未测试;Lake Problem对比为保守的same-candidate-set重放而非在契约规则下完整重优化。2. 因果机制论证不完全:scope condition(单调轨迹)的定义边界模糊,单调性充分性vs必要性未形式化;Stage 2的stochastic-to-deterministic切换对champion翻转的独立贡献未通过ablation隔离。3. 解决方案的创新性限制:metric contract本质上是标准设计模式(dependency injection + Design-by-Contract)的应用,无算法创新,改进的是工程规范而非科学方法论。