智能体系统★ 评分 9.0

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao
2026年7月4日
关键词
信用分配工具调用奖励代码代理多模态推理强化学习

核心发现

  1. DAPR的差分设计巧妙消除工具调用前的模型基线知识,直接衡量工具的边际效应,避免了"内在改进"与"工具实际收益"的混淆——思考链:通过Δ=r_out(a₂)-r_out(a₁)的设计,使负责的工具调用获得正奖励,有害调用获得负奖励。

  2. OGAR的分段路由机制根据调用结果(有用/有害/冗余/必要但失败)将最终答案优势只分配给负责的token段——思考链:解决outcome-only奖励的普遍广播问题,避免冗余工具调用被过度激励,且无需额外成本项。

  3. 差分操作天然抵抗探针攻击,模型即使在早期提交答案也无法欺骗系统(共模偏移相消,Proposition 1形式化证明)——思考链:实验中additive-probe基线初期收益快但最终被超越,正验证了这一防护机制。

  4. 在12个权威基准上相比最强开源基线PyVision提升4.4个点(68.1% vs 63.7%),且端到端延迟最低(Table 2),打破精度-效率权衡假象——思考链:同时优化两个维度表明TACO学到的是真正的有选择性工具使用。

  5. 在Qwen3-VL-8B更强基线上仍获+5.9提升(78.8% vs 72.9%),证明收益来自机制而非数据或基线幸运——思考链:剔除替代假设,增强方法可信度和适应性。

实验规模

评估规模:12个权威基准共58000+样本,覆盖感知(HR-Bench-4K/8K、V*等)、推理(MathVision、MathVista、WeMath、LogicVista等)、通用(MMStar、ChartQA、BLINK等)三维度。基线对比:15个模型,包括闭源(GPT-4o、Gemini-2.5-Pro)、开源MLLM(Qwen2.5-VL-7B、Qwen3-VL-8B、InternVL3、LLaVA-OneVision)、代码工具代理(Thyme、DeepEyes、DeepEyesV2、Pixel-Reasoner、Mini-o3、MathCoder-VL、CodeV、PyVision等)。训练配置:Qwen2.5-VL-7B基线,8×A100 80GB单节点,2个epoch SFT+1个epoch RL,G=8采样组,批次大小128,学习率1e-6。数据处理:SFT数据基于Thyme语料库,经execution validity、tool necessity、质量检查三重精选;RL数据采用CodeV开源数据集,经environmental fidelity和difficulty calibration两重过滤。消融验证:表3中w/o DAPR、w/o OGAR各自验证增益;跨模型迁移:Qwen2.5-VL-7B和Qwen3-VL-8B双基线验证(表4);敏感性分析:表8中α₁、α₂权重扫描;训练动力学:Figure 3展示精度奖励、完成长度、策略熵等过程指标。

局限性

TACO的适用范围受限于规则基础的答案检查器(如字符串匹配),对开放生成、多模态输出或答案形式多样的任务无能为力;对多工具顺序调用的处理仍停留在"整体工具分支"的粗粒度阶段,无法对链中单个调用精细归因。其次,论文基于"faithful probing"的理论假设(探针能忠实反映模型答案),但在模型输出不稳定或答案边界模糊的病态案例下,探针的greedy decode可能失效,导致Δ信噪比下降。此外,主要对标的许多基线(CodeV、PyVision等)发表时间接近,缺乏对明显更老或更弱基线的碾压式胜出。

Paper ID: 2606.30251