Pawel Huryn 质疑 agent 编码评测:一次成型不等于未来不出回归
PawelHuryn · x · 2026-10-09
- Pawel Huryn 指出当前 agent 编码 eval 的结构性缺陷:agent 的测试只有一次机会,评分方不运行它们,后面也没有任何环节——所以 eval 无法回答「agent 会不会抓住下一次回归」。
- 原帖作者 kunchenguid 回应:回归测试其实已被覆盖——把预置测试套件整体禁用后,agent 并未造成更多回归,且 deepswe 的隐藏测试明确检查回归,并附了细节链接。
- Huryn 仍坚持结论:评测只证明了 agent 不需要测试就能完成单次修改(它们不用编译就能理解自己写的代码),但对测试在未来维护中的价值没有说明。
所属事件:社区激辩 agent 编码评测能否测出回归(3 条相关)→
「编程与Agent」频道最新
- 6 个模型 MCP 工具实测:Opus 5.5 领先,开源模型成本仅 13% — shensi · 2026-10-09
- 推理层代码正被 AI Agent 接管,训练环节或许也不远了 — aparnadhinak · 2026-10-09
- 别全用 Opus:Sonnet 主力+Haiku 并行+Opus 架构师的省钱分工法 — Arindam_1729 · 2026-10-09
- $200 Max 计费实录:多智能体吵了 40 分钟没碰一个文件 — BLUECOW009 · 2026-10-09
- Claude Code 2.1.295:新增钩子阻断机制,提示词 tokens 暴涨 23.5% — ClaudeCodeLog · 2026-10-09
- Claude Code 2.1.295 发布:143 项改动,hook 失败可阻断执行 — ClaudeCodeLog · 2026-10-09