智能体系统★ 评分 5.8

The Organizational Behavior of Agentic AI: Collective Intelligence in Human-Agent Workflows

Canhui Liu
2026年7月4日
关键词
多智能体协调语境事务成本组织行为人-AI协作自适应编排

核心发现

  1. 人类模仿组织形式(管道制、委员会、层级)在智能体系统中失效:委员会制集体效率下降12.69分,因为这些形式在人类中依靠身份和信任,在AI中却沦为语境压缩和错误传导。思考链:组织形式的有效性取决于其如何移动和保护任务语境,而非其社会名义。
  2. 语境事务成本(CTC)是解释多智能体效率的中心机制:从最低到最高CTC四分位,效率下降91.41%。这表明多智能体的价值完全取决于语境在边界间的可用性——Token负担、握手损失、压缩损失、语义漂移、验证负担、治理成本的累积决定了集体智能是否成为生产力还是浪费。思考链:经典交易成本理论需要扩展以适应AI时代的协调问题。
  3. 规模扩展需要工程化多样性而非代理数量:自由文本辩论的最优规模是1个代理,而受限通信只能支持5-10个代理。多个共享相同错误结构的代理产生伪多样性,真正的规模需要模型异质性、工具异质性、独立检索和对抗验证。思考链:集体智能的度量不是代理计数,而是错误独立性和验证机制的质量。
  4. 自适应编排优于固定组织形式:自适应元组织根据任务属性动态选择组织拓扑,赢得69.20%的任务,效率比最佳人类模仿形式高395.26%;无提示的DQN组织选择器拟合的策略效率(24.14)与手工编码自适应(24.21)相近,表明组织形式本身是可学习的变量。思考链:最优的多智能体系统不是预设的组织图表,而是根据任务条件动态适应的协调算法。
  5. 实际LLM运行揭示边界条件:强商业模型在单代理执行上效率最高(81.44),多代理CTC压倒了质量收益;而在开源模型上,多代理协调有利。思考链:多智能体的价值取决于基础模型的能力水平——强模型时协调成本过高,弱模型或高风险任务时多代理价值才显现。

实验规模

Study 1:8000个合成知识工作任务 × 7种组织形式 = 56000个任务-组织对,每个任务由复杂性、可分解性、耦合度、可验证性、模糊性、风险、知识速率7个维度参数化。Study 2:4个任务族(软件修复SWE-bench风格、长文档QA LongBench风格、法律审查LegalBench风格、文献综合QASPER风格) × 4种组织形式 × 5个模型(OpenAI gpt-4.1-mini、Gemini gemini-2.5-flash、Claude haiku-4-5、Qwen2 7B、Mistral)= 48次真实LLM运行,逐事件追踪Token、握手、验证结果、延迟。Study 3(附录):提示变异(4种风格)、开源模型对比、无提示DQN组织选择器验证,拟合策略效率与手工编码相近。

局限性

  1. 实验外部效度受限:真实LLM实验仅涵盖4个任务族、5个模型,总样本量小(商业12次、开源8次),远低于工业级应用规模。合成任务虽可控,但其参数空间是否覆盖医疗诊断、法律合规、科学发现等真实工作流的多样性存疑,结论泛化性仍需田野验证。2. 语境事务成本的量化方法不够透明:公式中的6个成本分量(Token负担、握手损失、压缩损失、语义漂移、验证负担、治理成本)的具体度量方法和权重校准方式未明确交代,导致CTC框架在实践中的可操作性存疑,从业者难以根据该框架精确预测或优化多智能体系统。3. 对多智能体内部错误相关性的分析不足:论文强调伪多样性,但缺乏定量的错误相关性度量与诊断方法。在真实系统中如何判断多个代理是否产生相关错误,论文未提供工程化解决方案,这对从业者至关重要。
Paper ID: 2606.30986