对话模式让 Agent 成功率从 100% 跌到 60%,UiPath 开源对话式评测框架
EvalRaccoonDev · reddit · 2026-09-23
UiPath 团队指出,多数 agent 评测都把完美 prompt 直接喂给模型,不够真实。他们在开源评测框架 codereval 中内置了一个「模拟用户」:知道全部需求,但只在 agent 主动提问时才回答。
实测 5 个任务的结果:
- 完整 prompt 下 5/5 成功;换成模拟用户只有 3/5 成功,成本还增加 44%。
- 失败案例都是 agent 没问清需求,直接做错了东西。
- 在升级排障任务上两种模式都是 5/5 成功,但对话模式成本 +106%、耗时 +199%——说明单 prompt 评测既看不到失败,也看不到时间和金钱的代价。
框架与模拟用户文档均已开源,可直接用于测试「会藏信息的用户」场景。
「编程与Agent」频道最新
- Matt Pocock:与其追模型发布,不如打磨 agent 的运行环境 — mattpocockuk · 2026-09-23
- Uncle Bob:AI 没改变任何事,混乱越大项目越慢 — blaizedsouza · 2026-09-23
- GBrain 开源:把你的记忆、工具与技能接入任意 AI — garrytan · 2026-09-23
- 播客实测:用 AI 工具花 8 美元硬件做出小游戏 — aishashok14 · 2026-09-23
- 四轮实测发现:搜索预算耗尽前,Agent 从不点开原始来源 — memokris · 2026-09-23
- TypeSafe 用单次调用给 RAG 段落打概率分,自动留删抗注入 — marlene_zw · 2026-09-23