智能体系统★ 评分 6.2

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo
2026年7月4日
关键词
多智能体LLM辩论自适应停止规则局部k-NN下界风险预算分解可审计部署

核心发现

  1. 局部k-NN正确性下界(Theorem 1-3)将多轮辩论中的停止决策形式化为可控的风险问题,通过预算分解 $\beta=\delta+\alpha+\varepsilon_{\text{act}}$ 分别控制统计失败、残差风险和表示间隙。

  2. 难度归一化部署策略(Eq. 12)通过 $\beta_d=\lambda^*d \hat{e}{T,d}^{\text{train}}$ 从训练数据预测性地导出任务特定预算,无需测试集调优,使激活率与任务难度解耦。

  3. 在MMLU-Pro(71%激活率、93.9%精度)和BBH(84%激活率、96.4%精度)上,消耗的预算仅为9-12%,而相同风险设置下的基线(CRC、Selective Prediction)过度激活至100%,消耗18-82%预算。

  4. 经验模数信封(Eq. 7)及其压力测试(Table 4)提供了对Assumption 3的可证伪诊断,但子任务级分析(Table 17)显示在推理密集任务(法律、逻辑)上WA/β达0.24-0.28,接近或超过设定的 $\varepsilon_{\text{act}}=0.02$,暴露了表示间隙假设的脆弱性。

  5. 匹配自动化率对比(Table 2)显示在相同激活率下,本方法与调优的标量阈值在精度和WA上无统计差异($|\Delta\text{Acc}|\leq 1.6$pp),表明核心优势源于事前预算推导而非质量提升,其实际部署价值相对有限。

实验规模

评估涵盖6个基准测试,总计546-8678实例:MMLU-Pro(8312个,10选1多域),LogiQA(8678个,4选1逻辑推理),ARC-Challenge(2590个,96%基准精度),BBH(2395个,10个推理子任务),MuSR(756个,多步软推理),GPQA(546个,研究生科学选择题)。三个异构智能体(Claude Haiku 4.5、DeepSeek-R1、Qwen-3 32B)进行4轮辩论。数据集随机50/50分割为train/test,训练集再分20/80为模数估计与本地查询库。与9条基线对比,包括4种风险控制方法、2个自有消融、3种启发式。报告基于10次独立随机分割的均值与标准误,标准误控制在WA/β < 0.014以内。

局限性

第一,核心Assumption 4(表示间隙)的实际有效性存在显著缺陷。子任务级安全审计(Table 17)显示在法律、逻辑推演等推理密集领域,WA/β达0.24-0.28,远超设定的0.02目标,表明2D状态 $(p_t^{(1)}, \Delta_t)$ 在这些任务上捕获的信息不足,预算保证的有效性受损。第二,匹配自动化率对比(Table 2)表明本方法与调优的标量阈值在精度与WA上无统计差异,核心优势退化为"事前导出阈值"而非"更优的质量",该优势在实际部署中价值有限(因final-round错误率可廉价地事先测试)。第三,论文缺乏分布偏移鲁棒性评估,仅在单一train/test分割上验证,跨数据集、跨模型版本、跨时间的泛化能力完全未知。

Paper ID: 2606.29654