METR 新指标衡量智能体何时比人类更贵
The Decoder · rss · 2026-07-27
METR 提出“支出时域”,衡量智能体何时比人更贵
- METR 提出一个新的指标 “expenditure horizon”,用美元成本来衡量 AI 智能体在某项任务上何时不再具备成本优势。
- 文章提到,基于 NanoGPT speedrun 的早期结果并不乐观,而且这个指标本身仍有明显盲点。
- 同时,文中也指出 更新一代模型 可能会改变结论,因此它更像是一个仍在演化中的评估框架,而不是定论。
「编程与Agent」频道最新
- 一个 @asciidotdev agent 自动搭好 sandbox,还同步了文件和 CLI — jasonkneen · 2026-07-27
- Claude Code 的 ultracode 模式能造浏览器游戏,但烧了 2500 美元 token — majidmanzarpour · 2026-07-27
- LangChain 发布 Deep Agents v0.7.0b2,基座 tokens 减半 — LangChain · 2026-07-27
- Hermes Field Kit 增加开源访谈技能,先问清需求再开工 — alexcovo_eth · 2026-07-27
- 一个用 n8n 和 Supabase 搭的 GPT-4o 接待员,先聊天后留资 — frog_omo · 2026-07-27
- Anthropic 相关讨论认为智能体应从循环转向图与日志 — viksit · 2026-07-27