METR 用 NanoGPT 测出 AI 优化能力的“支出视界”
gleech · x · 2026-08-04
METR 提出用“支出视界”衡量 AI 优化能力
这篇研究把 AI agent 在优化任务上的能力,定义为在人力、token 和算力成本共同约束下,谁更划算。作者提出一个叫 expenditure horizon(支出视界) 的指标:当预算低于某个点时,AI 更有效;超过这个点后,人类反而更划算。
- 论文用 NanoGPT speedrun 做了实证示例。
- 他们估算:在 NanoGPT 优化里,每提升 1% 大约需要 2500 美元的人力成本。
- 对初步的 agentic 优化实验,作者称在花费超过 1 万美元后,估计得到的支出视界约为 0–3000 美元。
论文的核心问题是:AI 到底在多大程度上加速了 AI 研发。作者认为直接测这个问题很难,于是用成本曲线交叉点来近似刻画。
「研究」频道最新
- 模型窃取论文证明需更强张成假设,作者已修正 — ArthurConmy · 2026-08-04
- 模型窃取论文作者承认原始定理有误,但可修正 — ArthurConmy · 2026-08-04
- RedMonk 说受访开源代码里只有 1% 由机器生成 — rseroter · 2026-08-04
- 机器人行走实验加了新奖励,但仍有 80% 失败率 — carlosdponx · 2026-08-04
- Airbnb 公开内部 AI 评测栈:日抽样 5% 流量 — econoar · 2026-08-04
- Aero Hand Open 以 314 美元发布开源灵巧机械手 — TinfoilTricorn · 2026-08-04