60/60 全跑完却 0/60 正确:Agent 执行成功不等于结果可信

DMAE1133 · reddit · 2026-09-19

一位 Agent 基准评测开发者在同模型消融实验中撞上一个被普遍低估的失败模式:执行成功不等于结果正确。

核心结论:execution success != correctness,self evaluation != independent verification。让同一个模型自己判断输出是否有效并不可靠,模型拓扑不是信任边界。

他正转向更严格的责任分离架构:

在 302 个单元的跨供应商配对评测中,采用门控的设置在 HotpotQA、MATH 500/AIME、MMLU 上录得正向提升,但同模型对照也出现负向案例——这让他对无外部验证的 debate/ensemble 循环越来越怀疑。目标架构是:单 Agent → 外部验证 → 仅在证据不足时升级人工。作者正在将这些打包为 AdaptOrch(已声明利益相关)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →