开发者开源 agent 工具层基准:专测鉴权、重试与记忆类失败

Kind-Atmosphere9655 · reddit · 2026-09-04

一位 Reddit 开发者指出,现有 agent 评测大多只看模型是否给出正确答案,忽略了另一类失败:模型选对了动作,但工具层用错账号、索要过多权限、重试时产生重复副作用、未验证最终状态就宣称成功、或丢失记忆。

他正在构建一个开源基准来专门测试这个「agent 与真实世界之间的层」,方法是固定 agent、模型、prompt 和任务,只替换能力提供方,并用独立的验证器检查外部状态。目前仓库处于 pre-alpha:已有 10 个公开任务契约和可运行的验证器与 harness,尚无生产后端和官方提供商分数。

作者向社区征集:你在 auth、工具调用、记忆、审批、重试或沙箱里见过最恶劣的真实失败是什么?什么证据能让你相信任务真的成功了?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →