智能体系统★ 评分 4.0

Minority Sentinel: When to Overturn Majority Voting in Multi-Agent LLM Debates

Chuan He, Zebin Chen, Zhengyi Yang, Shaobo Qiao, Mingchen Ju, Jiate Liu, Dong Wen, Guanfeng Liu
2026年7月4日
关键词
多智能体辩论少数意见恢复错误相关性元分类器多数投票失败

核心发现

  1. 多数投票失败现象:39.1%样本出现2:1分歧,其中25.5%少数方正确,多数投票准确率74.3%而理论上界84.3%,恢复空间10.0%——根本原因是LLM共享预训练语料导致错误高度相关,违反孔多塞定理的独立性假设。
  2. 认知正交性洞见:LLM-as-Judge基线失败(NG -1.37%)因共享知识盲点,而行为特征编码的统计模式足以绕过LLM语义层的相关错误。
  3. Debate Fingerprint设计:22维特征分为动态(10维:立场变化、一致性模式)、元数据(4维:投票结构演变)、语义审计(8维:推理质量),多粒度融合捕捉辩论信号。
  4. LightGBM元分类器实现:Flip Precision 81.2%、Net Gain +1.71%、Recovery Rate 22.3%、20个随机种子全部正收益,避免了LLM判官的陷阱。

实验规模

六个基准数据集(ARC-Challenge、CommonsenseQA、GSM8K、MMLU-STEM、TruthfulQA、WinoGrande)共1,754个问题。三异构LLM智能体(GPT-4o-mini、Gemini-2.0-Flash、Claude Haiku)进行独立Round 0回答+2轮结构化辩论,产生686个分歧样本(39.1%)。Stratified 5-Fold交叉验证,20个随机种子验证稳定性。LightGBM分类器在686个样本上训练,阈值τ在[0.05, 0.95]网格搜索优化(步长0.01)。

局限性

样本量极度不足且分布严重不均(ARC-Challenge仅33个分歧、14个MT样本),per-dataset阈值优化存在明显过拟合风险,缺乏bootstrap置信区间和统计显著性检验。语义审计特征(8维)依赖GPT-4o,与论文宣称的'认知正交性'存在逻辑矛盾,削弱核心论点。缺乏跨域泛化能力,新数据集需要重新标注分歧样本并优化τ,无法零样本应用。

Paper ID: 2606.29270