智能体系统★ 评分 4.0
Experience Graphs: The Data Foundation for Self-Improving Agents
Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi
2026年7月4日
关键词
经验图数据库自我改进智能体树搜索持久化向量-图混合查询闭环训练基础设施
核心发现
- 经验图是新的数据库工作负载:长期搜索任务(代码生成、科学发现、硬件优化)产生的树形追踪包含执行工件、奖励、因果链接等结构化数据,现有系统将其视为临时状态,导致知识流失、无法跨会话复用和训练数据提取困难。这与数据库社区历史经验一致——每一代新工作负载都需要专用系统架构。
- 统一查询层融合了三种检索模态:Trellis的核心技术创新是将SQL、图遍历(Cypher)和向量相似度检索整合为单一逻辑查询计划,而非现有系统的多次RPC调用。搜索操作本质上是数据库访问模式——恢复是边界查询、跨会话复用是向量查询加图遍历、训练提取是物化视图。
- 生产验证显示10倍收敛加速但伴随根本权衡:在Meta KernelEvolve中,跨会话记忆将达到1.2倍加速的步数从51降至~5步(10倍改进),令牌成本降低52%(因减少调试循环)。但关键观察是探索-锚定权衡——高记忆注入率收敛快但多样性低,最优解反而来自无记忆基线(1.49×vs.1.36×),揭示记忆质量管理需要一流的数据库技术而非启发式方法。
实验规模
生产环境单点验证:Meta KernelEvolve加速器内核优化系统(NVIDIA/AMD/MTIA/CPU四平台目标)。测试配置为~100节点会话×100个独立配置,每配置3轮重复以控制LLM采样方差。对比条件为无记忆基线 vs. 记忆注入率p=0.1 vs. p=0.5两个策略。核心指标:错误节点率从55%下降至34%(p=0.1)和21%(p=0.5);1.2倍加速达成时间从51步加速至5步;单步令牌成本由于减少调试重试而节省52%;有效节点占比从79.5%提升至100%。训练数据以生产会话日志直接物化为SFT轨迹、DPO配对、GRPO分组,无需单独回滚。
局限性
系统仍处于原型阶段,第7节列举的8个核心开放问题(多模态查询规划、并发树搜索一致性、物理设计、治理约束下的视图维护、双时间语义等)表明关键的数据库架构决策仍未解决。其次,生产验证仅限Meta内部的单一应用场景(内核优化),虽提及硅验证试点但无定量数据,其他应用域的泛化性存疑。第三,论文揭示的记忆注入权衡(高注入率收敛快但多样性低、最优解来自冷启动)指向一个被轻化处理的根本问题——记忆质量的自动评估、动态调整和防止过时数据的机制目前缺失,这可能是整个闭环自改进系统的关键瓶颈。