智能体系统★ 评分 7.2
Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing
Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson
2026年7月4日
关键词
多智能体路由提示注入攻击几何防御线性算子离线校准
核心发现
- 架构级防御的结构性有效性:完全剔除推理时文本处理使嵌入指令无法影响路由函数,描述注入攻击ASR从75.3%降至0.2%,差异源自设计而非参数调优。
- 隐性安全训练的防守机制:校准阶段后门智能体触发时被标记为-1,学习的算子自然编码与安全嵌入子空间的负相关,5种数据投毒攻击ASR均≤2.4%,无需专用分类器。
- 鲁棒性与扩展性的非平凡权衡:推理成本与文本长度独立,系统提示从10到1000 tokens时AutoGen延迟爆炸至2500ms而ANTAP恒定38ms;智能体增加反而降低ASR(K=2时3.35%→K=19时0.46%)因为良性算子密度提升。
- 自适应攻击的坚硬性限制:线性结构限制令牌替换搜索空间,EmbedLLM在3个令牌时ASR跃升至86%而ANTAP跨1-16令牌恒定在55-63%(±8pp波动),表明几何防御对表示学习的定性优势。
实验规模
使用MMLU(1000校准+1500测试+100安全)、BBH全量及AgentHarm(32校准+176测试)数据集。智能体池包括基础配置5智能体(1恶意)至扩展配置19智能体。对标AutoGen文本路由和EmbedLLM表示学习路由。攻击包括描述注入、5种LoRA数据投毒后门变体(BadNet/Sleeper/VPI/MTBA/CTBA,各400投毒+400清洁样本)及贪心令牌替换自适应攻击(80候选/位置,8迭代,7随机种子)。消融研究覆盖场景、模型同质性、提示长度、描述长度、智能体数量;超参数扫描包含λ、ε、4种编码器及校准集大小。
局限性
论文假设离线校准环境和嵌入模块可信,但若校准数据被污染或嵌入空间本身被对抗样本欺骗,防御基础沦陷。其次,线性近似的固有局限导致系统提示从10到1000 tokens时精度下降13.81pp(69.04%→55.23%),暗示复杂多维工作流中的能力表示不完全。第三,AgentHarm实验仅使用32样本校准属严重欠采样,且开放式有害请求检测的ASR仍高达54.55%,表明几何方法在无约束场景的泛化能力有限。