群发资讯网

腾讯:E-Bench多步工具评测 📖标题:E-Bench: Benchmark

腾讯:E-Bench多步工具评测
📖标题:E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios
🌐 2607.23722v1

🛎️文章简介
🔸研究问题:如何构建一个可控、可扩展且能真实评估大语言模型在复杂产品场景下多步工具使用能力的基准测试?
🔸主要贡献:论文提出了E-Bench,一个完全合成的基准测试,通过解耦环境与任务生成,利用数据库状态差异进行确定性评估,揭示了当前模型在多步工具交互中的可靠性瓶颈。

📝重点思路
🔸环境合成:采用图引导的数据库填充技术,基于关系模式按拓扑顺序生成无孤立记录、参照完整性一致的模拟产品环境(涵盖王者荣耀、QQ音乐、腾讯会议)。
🔸任务合成:利用生成器-求解器不对称机制,生成器拥有全量数据和代码权限来设计任务并记录真实的状态变更差异作为金标准,而求解器仅能通过受限的工具接口访问环境,从而制造信息缺口和工具缺口。
🔸确定性评估:摒弃LLM裁判,直接比较代理执行后的最终数据库状态与预计算的真实状态差异,实现客观、确定性的评分。
🔸扩展设置:引入E-Bench-Code变体,允许代理执行代码以部分弥补工具缺口,对比分析代码执行对性能及交互成本的影响。

🔎分析总结
🔸性能瓶颈:多步工具使用仍未解决,最强模型Kimi-K3在E-Bench上的平均通过率仅为73.79%,且衡量可靠性的Pass3指标低于60%,表明模型表现不稳定。
🔸代码执行优势:赋予代码执行能力后,所有模型准确率提升,Opus-4.8跃居第一,同时显著降低了API调用次数和Token消耗,证明代码能有效封装复杂的工具调用逻辑。
🔸能力差异:代码执行主要提升了数据获取、过滤和聚合等计算密集型任务的表现,而在跨实体级联和边界判断等推理密集型任务上提升有限。
🔸领域难度:王者荣耀领域最具挑战性,QQ音乐相对简单;不同模型在各领域的排名波动较大,显示鲁棒的多步工具评估需覆盖多样化领域。

💡个人观点
论文解决了传统基准测试中环境不可控、任务难以规模化及评估主观的问题,通过“图引导数据库填充”确保环境的逻辑一致性,利用“生成器-求解器不对称”巧妙构造了必须通过多步交互才能解决的复杂任务。

LLM 大模型 agent 论文分享