开发者开源 agent 工具层基准:专测鉴权、重试与记忆类失败
Kind-Atmosphere9655 · reddit · 2026-09-04
一位 Reddit 开发者指出,现有 agent 评测大多只看模型是否给出正确答案,忽略了另一类失败:模型选对了动作,但工具层用错账号、索要过多权限、重试时产生重复副作用、未验证最终状态就宣称成功、或丢失记忆。
他正在构建一个开源基准来专门测试这个「agent 与真实世界之间的层」,方法是固定 agent、模型、prompt 和任务,只替换能力提供方,并用独立的验证器检查外部状态。目前仓库处于 pre-alpha:已有 10 个公开任务契约和可运行的验证器与 harness,尚无生产后端和官方提供商分数。
作者向社区征集:你在 auth、工具调用、记忆、审批、重试或沙箱里见过最恶劣的真实失败是什么?什么证据能让你相信任务真的成功了?
「编程与Agent」频道最新
- IBM 发布 DRACO:动态评分细粒度信用分配,训练长程智能体免验证器 — ibm-research · 2026-09-04
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 用户用 Grok Build 全自动剪出 Tesla Cybercab 电影感视频 — elonmusk · 2026-09-04
- Agentic RAG 该让 Agent 决定去哪检索,还是怎么检索? — Arc_bong · 2026-09-04
- 开发者反思:模型再强,连接器不通也白搭 — shensi · 2026-09-04
- GPT-6 Astra 使用心得:爱追问澄清,需显式授权自主干活 — daniel_mac8 · 2026-09-04