HANDBOOK.md 检验 agent 在长流程里是否真遵守 SOP
dair_ai · x · 2026-07-29
Surge AI 发布了一个新的长上下文 agent 基准 HANDBOOK.md,关注点不是“能不能做对题”,而是agent 是否真的遵守了长篇制度文件/操作手册。
- 这个 benchmark 面向企业场景:系统提示词、policy 文件、skills 文档往往被放进上下文里,希望它们能在长时间工具调用中持续约束行为。
- 论文设置了 65 个 agent 任务、覆盖 5 个领域 和 10 家虚构公司;每个任务都运行在独立环境里,包含文件工作区,以及通过 MCP 暴露的邮件、聊天、日历、工单和电商工具。
- 每个任务使用 20 到 124 页不等的 handbook,并且会改写 10 份基础 SOP 之一,让模型不能靠记忆刷题;评分也用确定性的程序化 rubric,检查“该做的是否做了、禁做的是否做了”。
- 论文给出的结果是:在严格评分下,31 个配置里的最佳模型只通过了 36.2% 的任务,大多数前沿配置都低于 25%。
「编程与Agent」频道最新
- OpenSquilla v0.5.1 将接入与路由分离并降本 — hey_abusiddik · 2026-07-30
- Google ADK 文章称工具拦截器是 agent 安全关键层 — fhinkel · 2026-07-30
- Eragon 接入 Merge API,可在 350+ 个模型间路由 — shensi · 2026-07-30
- Agent Retrieval Bench 显示,编码 Agent 常在补上下文前就先失手 — Bowen Qin · 2026-07-30
- MCP 服务器漂移时,用户设置可能失去指向 — Loocor · 2026-07-30
- MCP 反馈工具想替用户提需求,但可能只收到夸奖 — hermjohnson · 2026-07-30