METR:跑 eval 要舍得花 token,难题已用 50–100 亿
idavidrein · x · 2026-07-03
David Rein 推荐 AISI(AI 安全研究所)的博客,并指出:如果正在做模型评测,大概率token用得不够。
他以 METR 为例,称其最难的任务已开始消耗 50–100 亿 token(含缓存),否则较新的模型没有充分发挥空间。这一观点强调了充足推理预算对严肃 agent eval 的必要性。
「编程与Agent」频道最新
- 开发者把 Claude Code 和 Codex 历史合并成千万级消息归档 — doodlestein · 2026-07-27
- 谷歌 15 个免费 AI 工具覆盖营销、编程和音乐 — aigclink · 2026-07-27
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27