MirrorCode 基准显示,Opus 4.7 用 14 小时、251 美元完成长任务
Jsevillamol · x · 2026-07-28
Epoch 和 METR 发布了 MirrorCode,这是一个面向长周期编程任务的 benchmark,要求 AI 仅凭 CLI 访问去重写软件。
- 这个 benchmark 最早在 4 月被提及,现在补充了更多测试。
- 它衡量模型能否在没有源代码、也不能上网的情况下,重构出完整程序结构,而不是逐行翻译代码。
- 文中给出的一个醒目结果是:Claude Opus 4.7 完成某项任务用了 14 小时,推理成本约 251 美元;作者估计这类任务人类要花 2–17 周。
- 文章还指出模型进步很快:一年前的领先模型大约只能做到 30%,而且主要只能处理更简单的程序。
- 示例任务包括 pkl、gotree、qsvselect 等。
- 配图来自 Jack Clark 的 newsletter,强调这是对长程编程与机器人任务能力的重要测量。
「编程与Agent」频道最新
- Every 报道称 OpenAI 内部几乎人人都在用 Codex — every · 2026-07-28
- 有人把高价值域名迁移整件事交给了 Codex — corbtt · 2026-07-28
- Raschka 将聊 DeepSeek-V4 与开权重 coding agent — hugobowne · 2026-07-28
- Codex steering 被评价为长会话里非常好用 — almmaasoglu · 2026-07-28
- Reddit 讨论 Omnigent 要不要再套 Hermes Agent — domb_ela · 2026-07-28
- Ruff 0.16.0 让一个提示词修完整个代码库 — xeophon · 2026-07-28