60/60 全跑完却 0/60 正确:Agent 执行成功不等于结果可信
DMAE1133 · reddit · 2026-09-19
一位 Agent 基准评测开发者在同模型消融实验中撞上一个被普遍低估的失败模式:执行成功不等于结果正确。
- 60/60 任务全部执行完成
- 60/60 拓扑正确激活
- 但产物中正确答案为 0/60
核心结论:execution success != correctness,self evaluation != independent verification。让同一个模型自己判断输出是否有效并不可靠,模型拓扑不是信任边界。
他正转向更严格的责任分离架构:
- 生成:Agent 产出候选补丁或动作
- 执行:在受控环境中运行
- 验证:外部检查构建、测试、静态检查等证据
- 失败分类:候选失败与环境/运行器失败分开归因
- 证据回执:记录跑了什么、通过/失败什么、哪些未验证
在 302 个单元的跨供应商配对评测中,采用门控的设置在 HotpotQA、MATH 500/AIME、MMLU 上录得正向提升,但同模型对照也出现负向案例——这让他对无外部验证的 debate/ensemble 循环越来越怀疑。目标架构是:单 Agent → 外部验证 → 仅在证据不足时升级人工。作者正在将这些打包为 AdaptOrch(已声明利益相关)。
「编程与Agent」频道最新
- rasbt 推出推理缩放教学视频:self-consistency 让准确率翻倍以上 — rasbt · 2026-09-19
- Swarm Aid 上线:AI agent 可互相雇佣、打赏、用 USDC 结算 — Dan_Jeffries1 · 2026-09-19
- 「写代码的手艺将消失」:Thorsten Ball 的激进预测引发热议 — Aizkmusic · 2026-09-19
- 别做通用平台了:用 LLM 为每个项目造一次性小工具 — StewartalsopIII · 2026-09-19
- 用 LLM 搭 SEO 决策层:分类搜索意图并按 GA4 排优先级 — ayushtweetshere · 2026-09-19
- OpenClaw 接入 WhatsApp 走官方 Agent API,开源插件告别封号风险 — heyneighbor · 2026-09-19