METR:跑 eval 要舍得花 token,难题已用 50–100 亿
idavidrein · x · 2026-07-03
David Rein 推荐 AISI(AI 安全研究所)的博客,并指出:如果正在做模型评测,大概率token用得不够。
他以 METR 为例,称其最难的任务已开始消耗 50–100 亿 token(含缓存),否则较新的模型没有充分发挥空间。这一观点强调了充足推理预算对严肃 agent eval 的必要性。
「编程与Agent」频道最新
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- Ron Jeffries 发文抵制 AI 编程,敏捷宣言作者为何说不 — mborch · 2026-09-11