智能体系统★ 评分 4.5
ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit
Abhijnan Nath, Nikhil Krishnaswamy
2026年7月4日
关键词
多轮信息寻求信念状态回合级信用分配策略梯度优化语言模型强化学习
核心发现
- 理论证明:在某些EDP中,忽视信念状态的策略成功率指数衰减($2^{1-d}$),而自适应策略最优;但该构造极端人为(二进制链依赖),真实任务中难以遇到
- 轨迹级回报的代数限制:同一总回报可对应不同信念下的不同动作质量,导致轨迹级优势估计器产生不可约误差$\mathbb{E}[\text{Var}(A|G)]>0$,理论正确但实际gap未量化
- ECHO在CSG上达45.3%解决率(超Claude Sonnet 43.1%),消除18.6%零信息回合,但这仅在精确后验可观测、候选集均匀分布的人工环境中成立;样本量仅3个种子,统计功效有限
- 沉默探索现象(reasoning文本仅0.9%)可能源于奖励形状而非信念感知,缺失消融对比验证机制
实验规模
主体实验在Clue Selector Game(CSG)进行:(1)训练配置:Qwen 2.5-1.5B Instruct,在线RL,3个独立种子,100个秘密数字(1-100)作训练,泛化测试到N=200;(2)基线对比:7个前沿模型(Claude Sonnet、GPT-4系列)零样本,5种提示变体(CoT、ReAct),3个RL基线(GRPO、RLOO、离线SFT+RL),7个规模参考(0.5B-14B);(3)评估指标:7个过程级指标(Zero消除率、Qual质量、Ground接地率等),每轨迹≤10步;(4)样本统计:仅3个种子进行配对t检验(p<0.05),总有效样本<5000条,标准误(SEM)普遍≥1,统计功效存疑
局限性
论文局限性:(1)理论构造极端(二进制链)与真实任务差距巨大;CSG中后验精确均匀分布、观测确定性消除,而真实诊断/搜索任务涉及嘈杂观测、隐藏假设空间、非均匀先验——方法是否泛化成疑;(2)实验仅在单一玩具环境验证,未在医学诊断、网页搜索、故障排查等真实信息寻求任务上测试,样本量仅3个种子,与Claude的2.2个百分点差异处于SEM重叠范围;(3)方法实用前景黯淡:需精确后验计算(LLM中如何高效获得?)与信息增益函数设计(真实任务中谁来定义?),且无法证明沉默探索源于信念感知而非单纯奖励形状,关键消融缺失