智能体系统★ 评分 6.2
A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks
Jinliang Xu, Liping Ma
2026年7月4日
关键词
代谢多智能体优化器闭环资源分配公平预算基准评估算法消融实验元启发式验证
核心发现
- MMAO在标准基准下保持竞争力:CEC2017连续任务平均秩次1.063(vs PSO-lite/DE-lite/ES-lite的2.25-5.56),TSPLIB离散任务平均间隙7.84%(vs外部基线14.47%-405.01%),Mann-Whitney检验p<1e-15,统计显著性无可辩驳 → 验证了闭环资源循环的框架级有效性
- 核心机制的必要性存在但隔离不完全:NoEliteReinvest消融在连续侧引发性能8倍恶化(5125.78→38616.34),但离散侧NoGuidedReinvest与主方法仍相近(p=0.47)→ 暗示资源重投资在连续域关键,在离散域可能被工程细节掩盖
- 消融变体与主方法的性能间隙远小于外部基线差距:内部变体平均秩次接近(最差0.15分差),外部基线秩次可达5+ → 表明框架的稳健性好,但各组件的独立必要性仍需更深入的机理隔离
- 作者诚实界定结论边界:明确指出未与LKH-3/CMA-ES等竞争级求解器对标,高维混合函数精细化不足,离散验证范围有限 → 这种学术诚实提升了整体可信度,但也暴露了与工业级求解器的真实差距
实验规模
连续侧:CEC2017套件8个函数 × 2维度(10D/30D) = 16个任务,每任务20个随机种子 = 320次运行/方法;离散侧主赛道:TSPLIB 5个实例(eil51/berlin52/st70/eil76/kroA100) × 20种子 = 100次运行/方法;辅助验证:OR-Library多背包子集(规模较小);基线对比:连续侧RandomSearch/HillClimb/DE-lite/PSO-lite/ES-lite共5类,离散侧NN+2opt/RR-2opt/CI+2opt/IG-2opt共4类;消融族群:NoRoleDrift/NoEliteReinvest/WeakSuccessFeedback等5类主要变体,遵循相同重复试验协议;统计报告:Mann-Whitney U检验 + Cliff's δ效应量 + 秩次聚合,避免樱桃采摘偏差
局限性
首先,基线对比仍存在"温情度"问题——虽纳入了DE-lite/PSO-lite等经典变体,但未与LKH-3(TSP)、L-SHADE/CMA-ES(连续优化)等竞争级求解器直接对抗,现有优势可能被基线的实现质量所放大。其次,消融隔离不完全且机理理解停留在黑箱层面——离散侧的消融差异极小(表V中p值多>0.3),暗示该域优势源于启发式工程细节而非所宣称的"闭环资源分配"原理;轨迹诊断虽改进了呈现方式但仍为描述性而非因果性。第三,离散域验证的狭隘性威胁外部有效性——仅用5个TSP实例+1个多背包子集进行验证,无法断言"闭环原理对所有组合优化都适用";高维混合函数的精细化不足(F1/F10的大残差)也暴露了方法在难题前的无力。