如何公平评测 agent 架构:拆解工作流与模型路由的实验设计

jonah_omninode · reddit · 2026-08-25

作者提出一个编码 agent 评测设计,解决现有 benchmark 把模型与 harness 混在一个分数里的问题——失败时无法区分是模型能力、上下文组装、任务拆解、工具设计还是验收门导致。

实验交叉两个变量:工作流(单体任务 vs 拆成带显式契约与验收标准的有界切片)与模型策略(全前沿模型 vs 便宜模型起步、能力分级失败后升级)。

关键设计:冻结原始任务、工具、重试预算、验收标准与 verifier,四组都以最终交付结果而非 agent 报告的说服力评判;主指标为每次独立接受变更的成本、误接受/误拒绝率、首过接受率、验证耗时与三次重跑的可复现性。

作者坦承最大的未解混淆是预算归一化:拆解天然产生更多调用,给每片与单体相同的上下文/重试预算会补贴拆解组,而共享系统级预算又可能掩盖哪些切片真正需要更多容量。目前尚无结果,作者强调先让比较可证伪。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →