基准论文称单任务评测可烧超 3000 美元榨出更多能力
dejavucoder · x · 2026-08-04
一篇基准论文在强调:评测预算越高,越能“榨出”模型能力
帖子截图来自一篇对软件重现类 benchmark 的讨论,重点不是单纯刷分,而是说明不同评测方法在推理预算上的差距非常大。
- ProgramBench 通常每次运行大约只花 10 美元。
- 它给 AI agent 的引导信息更少,但会生成更多测试来覆盖目标程序。
- 相比之下,MirrorCode 在最贵的任务上,单次尝试可投入 3000 美元以上。
- 论文认为:当推理预算足够高时,agent 能解决更多完整实现任务。
- 还把它与 FrontierSWE、Terminal-Bench、SWE-Marathon、Vibe Code Bench 等端到端软件工程基准做了对照。
「编程与Agent」频道最新
- 阿里通义发布 Qwen3.8-Max,主打编程协作 — ccerrato147 · 2026-08-04
- 黑客松获奖项目 Uta Sensei 用音乐教日语,拿下 2000 美元 — Gradio · 2026-08-04
- OpenAI 公布 Codex 获奖者,每队可得 1 万美元 — Gradio · 2026-08-04
- Executor 把 MCP 和 OpenAPI 工具统一成一个 Agent 网关 — DanielLockyer · 2026-08-04
- Fizgig v3.2.0 新增 MiniMax H3 的实验性 LoRA 训练 — shootthesound · 2026-08-04
- Fizgig 上线 MiniMax H3 实验性 LoRA 训练,模型文件约 15.7GB — shootthesound · 2026-08-04