对话模式让 Agent 成功率从 100% 跌到 60%,UiPath 开源对话式评测框架

EvalRaccoonDev · reddit · 2026-09-23

UiPath 团队指出,多数 agent 评测都把完美 prompt 直接喂给模型,不够真实。他们在开源评测框架 codereval 中内置了一个「模拟用户」:知道全部需求,但只在 agent 主动提问时才回答。

实测 5 个任务的结果:

框架与模拟用户文档均已开源,可直接用于测试「会藏信息的用户」场景。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →