智能体系统★ 评分 6.8

When Latent Agents Lie: KV-Cache Integrity in Multi-Agent LLM Collaboration

Luís Brito, Carlos Baquero
2026年7月4日
关键词
KV缓存完整性多智能体LLM安全潜在协作自适应对抗攻击传输层认证

核心发现

  1. 完整KV协作相比文本协作在干净条件下有收益但不稳定:Qwen3-4B HiddenBench达EM/F1 0.338/0.486 vs 文本0.231/0.369,EM收益置信区间跨零[-0.015, +0.231],F1收益更强[+0.002, +0.233];Qwen3-8B和7,405条HotPotQA验证了定向结论但依赖279MB巨大KV传输。
  2. 隐藏状态可被完全利用,可见承诺无法检测:随机KV替换和8倍缩放直接将性能从0.323/0.471摧毁至0.000/0.000,即使可见commitment保持合理,transported KV已被篡改——暴露了visible verifier无法审计hidden channel的架构漏洞。
  3. magnitude-based quarantine对非自适应攻击有效但对自适应攻击完全失效:后特设threshold在HiddenBench和7,405条HotPotQA上检测随机/scale-8攻击达100%(无误杀),但norm-matched白盒梯度优化攻击绕过检测(0/65拒绝)同时将性能从0.323/0.471坍塌至0.077/0.119。
  4. 传输层HMAC-SHA256是唯一有效防护系统边界:HMAC manifest在replay测试中接受774/774诚实payload、拒绝295/295篡改payload,将post-handoff KV substitution挡在coordinator外,但仅覆盖传输层tampering、不防护endpoint compromise或compromised key。
  5. specialist隐藏状态携带可用证据但影响非均匀易被对手操纵:影响诊断显示21个潜在正确答案中10个删除关键specialist会翻转结果,targeted-false攻击因果诊断表明恶意specialist可通过KV引导这些影响(目标击中率0.312)。

实验规模

主要设置:65条transformed HiddenBench记录(官方artifact)+ Qwen3-4B模型(torch.float16)+ 确定性贪心解码(max_new_tokens=32)。扩展验证:Qwen3-8B HiddenBench副本(同65条)+ 完整HotPotQA数据集(7,405条distractor-validation)+ 100条HotPotQA白盒/溯源切片。攻击套件跨越Tier A(语义虚假specialist)、Tier B(随机KV替换、8倍缩放、符号翻转)、Tier C(白盒梯度优化norm-matched攻击)。防护诊断涵盖可见filtering、magnitude quarantine、learned anomaly detector、HMAC-SHA256 MAC重放验证(774/295)。KV传输:279.03 MB/样本(潜在)vs 0 MB(文本),估计并行critical path 2.379s(潜在)vs 3.009s(文本)。

局限性

  1. 样本量瓶颈与泛化风险:核心攻击/防护结果基于65条HiddenBench记录,白盒自适应攻击仅在100条HotPotQA切片验证,此规模在深度学习标准下极小,跨模型、跨任务、跨decoding regime的泛化能力未充分证实。2. 防护的residual blind spot:HMAC-SHA256仅防护post-handoff transported-KV substitution,而endpoint compromise(specialist runtime被攻击)、compromised transport key、semantic malicious specialists依然超出保护范围,防护边界并未闭合整个威胁面。3. 机制理解的黑盒性:论文证明隐藏状态可被利用,但对"为什么特定specialist的KV会被选中并影响最终答案"的因果机制理解不足;影响诊断是事后subset re-encoding而非严格干预实验,potential confounding factors未被隔离。
Paper ID: 2606.28958