智能体系统★ 评分 4.5
Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning
Carlos Baquero, Luís Brito
2026年7月4日
关键词
KV缓存合并交换律幂等性冲突自由复制数据类型多代理潜在推理RoPE位置编码
核心发现
- BagMerge(拼接+RoPE重编码)的非交换性导致最优序不可预测,跨体制、预算、模型规模变化(表3示6-14pp差异),无规则可循。这是问题的精确诊断。
- CanonicalMerge通过中层K范数排序(第15层)确定内容,使渲染缓存在任意输入排列下字节等价(Eq. 4),在合成张量(152排列对,N≤5)和真实Qwen3 KV态(28层1.7B与36层4B)上均通过位级验证。这是范式级的结构性保证,不依赖经验。
- LatentFragmentSet(内容寻址碎片集+集合并)将字节等价性从操作级升级为状态级CvRDT,实现幂等性和重复吸收。在重复交付实验中(Table 10),朴素重拼接在R=4时精度崩溃至45%且缓存4倍增长,而CvRDT保持93%精度和恒定状态——这是分布式系统约束下的必要特性。
- k>2时方法彻底失效:即使采用树形递归合并(treemerge),NEONYM家族精度仍崩溃至6%(表11),与par3相同,仅在seq3(完整顺序重处理)时恢复。作者诚实地承认:缓存并置是传输而非组合,需要模型重处理缝隙——这本质上否定了该方法作为k-通用解决方案的野心。
- 与输出级融合(PackLLM)的45pp鸿沟不是调优工件而是体制差异(Section 5.6, Appendix D):logit级平均化无法重构联合约束信息,而缓存级并置保留了K/V几何供注意力路由。但这一优势仅在k=2时成立。
实验规模
主基准:自构分割k=2数学基准(100问题×5家族,CONSTRAINT/RECIPE等),单抽100问题/cell(表3),多抽3×100(贪心,Appendix B);次要基准:HotpotQA桥接k=2(50问题,F1标准化打分);k>3验证:50问题/家族/抽(附录F,3抽×5家族)。模型覆盖极窄:仅Qwen3-1.7B(28层)与Qwen3-4B(36层),未跨架构验证。路由层敏感性扫描:ℓ*∈{5,10,12,15,18,22,27}(表5,单draw)+持留集独立扫描(ℓ*∈{9,11,13,15,17,19,21},数据种子7)。消融覆盖充分:合成张量排列不变性(152排列对,N≤5)、真实KV位等价性验证、重复交付精度/序列长度曲线(R∈{1,2,3,4})、潜在步预算×体制矩阵(40-20步)。统计方法:自举CI(10k重采样)、McNemar精确检验、Holm多重比较校正。
局限性
(1)方法适用范围致命受限于k=2:k>2时缓存并置无法实现组合推理,需模型重处理,本质否定了多代理通用性承诺。(2)真实基准验证严重不足:HotpotQA仅50问题样本(标准为6515),且F1被BagMerge default(0.632)超越,无法支撑方法泛化性声称;模型覆盖仅Qwen3单一家族,未跨架构验证RoPE相关性能。(3)查询-盲场景(论文联邦推理的核心动机)中K范数内容函数退化为近似平局,表现对比最优序下降4pp(表3,q-blind 20步),削弱了解决真实分布式场景的能力。