研究者称 Anthropic 认为 AI R&D 评测已饱和、缺乏信息量

dfrsrchtwts · x · 2026-09-23

dfrsrchtwts 指出(在回应讨论中澄清)其批评针对的是非 METR 的 AI R&D 评测:相关报告章节认为这类评测已饱和且不再有信息量,作者表示赞同;讨论中提到 METR 的 Sunlight、Budget NanoGPT、GamingBot 等评测可能仍有参考价值。

所属事件:研究者批评 AECI 评测报告精度虚高、AI R&D 评测已饱和(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →