如何公平评测 agent 架构:拆解工作流与模型路由的实验设计
jonah_omninode · reddit · 2026-08-25
作者提出一个编码 agent 评测设计,解决现有 benchmark 把模型与 harness 混在一个分数里的问题——失败时无法区分是模型能力、上下文组装、任务拆解、工具设计还是验收门导致。
实验交叉两个变量:工作流(单体任务 vs 拆成带显式契约与验收标准的有界切片)与模型策略(全前沿模型 vs 便宜模型起步、能力分级失败后升级)。
关键设计:冻结原始任务、工具、重试预算、验收标准与 verifier,四组都以最终交付结果而非 agent 报告的说服力评判;主指标为每次独立接受变更的成本、误接受/误拒绝率、首过接受率、验证耗时与三次重跑的可复现性。
作者坦承最大的未解混淆是预算归一化:拆解天然产生更多调用,给每片与单体相同的上下文/重试预算会补贴拆解组,而共享系统级预算又可能掩盖哪些切片真正需要更多容量。目前尚无结果,作者强调先让比较可证伪。
「编程与Agent」频道最新
- 用 Kaggle 免费 GPU 微调 Qwen3.8-27B — danielhanchen · 2026-08-25
- C# 语言实现 RAG 技术详解 — adnan_hashmi · 2026-08-25
- 实用技巧:给 Grok 上网的电脑装 Tailscale,人工中断减少六到七成 — IndraVahan · 2026-08-25
- 一人用Claude Code加Godot四周做出3D钓鱼游戏,总成本约300美元 — jocarrasqueira · 2026-08-25
- 专家观点:使用 AI 编程时保持“原味”配置或许更佳 — johnowhitaker · 2026-08-25
- 新基准 SWE Refactor Bench:Agent 全库重构存活率仅 5.4% — _akhaliq · 2026-08-25