评测显示所有模型都差?作者发现答案密钥取错了时间点
jgarg27 · reddit · 2026-10-09
一位运行生产环境 agent 的开发者分享了筛选低成本替代模型的踩坑经历:
- 结构化测试很有效:模型是否调用工具、输出 schema 是否合法、第一步选择是否合理——便宜、快速,能清晰区分模型。注意一个坑:看似弱的模型可能只是用了不同的工具调用格式
- 判断类测试翻车了:截取运行到一半的 transcript,让模型预测结论,再对照 agent 的最终答案打分——结果包括生产模型在内全部表现很差
- 定位问题:用生产模型对照它自己的中途决策,完美匹配,说明测试框架没问题。真正的问题在答案密钥——评分基准取自运行结束时的结论,而 agent 在中途往往会改变主意。相当于「用终点答案评判中点表现」
- 修正后:大多数便宜模型其实与生产模型水平相当,只有最弱的那个不行
- 成本警示:最便宜的开源模型在托管端点上更慢,一个模型在低并发就触发限流——单次调用便宜不等于每个决策便宜
核心教训:做廉价预筛评测时,评分基准的时间点必须与被测截点一致,否则评测结果毫无意义。
「编程与Agent」频道最新
- Eazo 让个人 Agent 变成可复用的 App,而非聊天窗口 — alifcoder · 2026-10-09
- Qoni 发布个人 Agent 基础设施:身份、执行与记忆三件套开箱即用 — alifcoder · 2026-10-09
- 用 Codex 剩余额度过夜创业:24 小时自动签下 10 家客户 — CtrlAltDwayne · 2026-10-09
- 20 秒起 250 台 VM 跑 Agent 沙箱,成本仅 10 美分 — RexDouglass · 2026-10-09
- NVIDIA 团队新论文:从基座模型预测后训练后编程 Agent 表现 — heghbalz · 2026-10-09
- BrickBench:评测 Agent 按文本拼乐高,能通过物理约束但逊于人类设计 — Peter Kulits · 2026-10-09