RecToolBench 发布:1200+ 任务评测推荐智能体的 MCP 工具编排能力
_reachsumit · x · 2026-09-28
arXiv 论文提出 RecToolBench,首个针对模糊用户意图下推荐场景工具编排的 benchmark,基于 Model Context Protocol(MCP)构建。
规模与结构:
- 1200+ 可执行任务,覆盖 3 个推荐领域、13 个 MCP server、32 个工具;
- 任务类型从单工具调用、并行调用到串行工具链与混合编排;
- 采用「合成-模糊化-评审」流水线生成可执行的模糊推荐任务,用规则执行检查 + rubric 式 LLM 评估智能体轨迹。
主要发现:对代表性 LLM 的测试显示,语法上合法的工具调用并不保证推荐成功;模型在语义参数定位、多步证据整合和有依据的最终推荐上普遍吃力,且编排复杂度越高问题越严重。
「编程与Agent」频道最新
- 自建 harness×模型基准:Claude Code 满分且 fastest 进前十 — dh7net · 2026-09-28
- ComfyUI 多实例模型重复占盘?开源工具 ComfyVault 一键去重 — ruashots · 2026-09-28
- Agent 折腾数周无解,StackOverflow 一搜答案直接到手 — itsOmSarraf_ · 2026-09-28
- 北大与谷歌提出 Harness-Zero:把 Agent 框架蒸馏进模型权重 — AxSaucedo · 2026-09-28
- 开源 PromptSentry:亚毫秒拦截提示注入的三层安全代理 — Ok-Negotiation342 · 2026-09-28
- jyangballin:ProgramBench 是评估多智能体编码系统的优质长程基准 — jyangballin · 2026-09-28