sudo L7 基准:60 项真实生产任务,最强编码 agent 仅通过 45%
echen · x · 2026-10-09
echen(sudo)与 Surge AI 发布新基准 sudo L7,衡量编码 agent 能否像 Staff 级工程师一样工作。核心论点:今天的编码 agent 已能当好「L3 初级工程师」——给它明确 ticket 就能写出优质代码;但 Staff 工程师的价值在于代码之外的专业判断——该建什么、生产环境会出什么问题、测试漏了什么、要不要做这个项目。
- 基准包含 60 个任务,大多取自真实公司的私有生产仓库,由真正拥有这些系统的工程师撰写。
- 用专家 rubrics 评分,维度涵盖功能正确性、工程质量、架构判断、思维伙伴能力(thought partnership)与不必要复杂度等。
- 结果:最好的 agent 仅完成约 45% 的任务,说明「编码只是工作的一部分」,agent 暂时停留在「天才白痴」的 L3 水平。
- 博客举了多个「技术上正确、职业上失职」的例子:明文显示密码的密码管理器、无回滚方案的数据库迁移、模拟行情却不告知用户的股票仪表盘。
所属事件:sudo L7 基准发布:最强编码 agent 通过率仅 45%(2 条相关)→
「编程与Agent」频道最新
- AI 造软件太快是灾难:长期无人维护,解法是让 agent 接管维护 — mark_k · 2026-10-09
- Matthew Berman 曝光工作流:几乎全用 Codex,ChatGPT 弃用 — MatthewBerman · 2026-10-09
- Higgsfield 发布 Katana,借 MCP 在 Claude 内做 AI 视频编辑 — aakashgupta · 2026-10-09
- 做法律 AI 合同审查 eval 有多难:十个律师十种改法 — graceisford · 2026-10-09
- 用 Codex Pets 插件把角色图变成动画宠物 — Deus-ex-Machina7 · 2026-10-09
- Inherit-MAS:借鉴生物遗传的多智能体系统测试时进化,省 34.6% token — Songtao Wei · 2026-10-09