METR:跑 eval 要舍得花 token,难题已用 50–100 亿

idavidrein · x · 2026-07-03

David Rein 推荐 AISI(AI 安全研究所)的博客,并指出:如果正在做模型评测,大概率token用得不够。

他以 METR 为例,称其最难的任务已开始消耗 50–100 亿 token(含缓存),否则较新的模型没有充分发挥空间。这一观点强调了充足推理预算对严肃 agent eval 的必要性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →