研究者称 Anthropic 认为 AI R&D 评测已饱和、缺乏信息量
dfrsrchtwts · x · 2026-09-23
dfrsrchtwts 指出(在回应讨论中澄清)其批评针对的是非 METR 的 AI R&D 评测:相关报告章节认为这类评测已饱和且不再有信息量,作者表示赞同;讨论中提到 METR 的 Sunlight、Budget NanoGPT、GamingBot 等评测可能仍有参考价值。
所属事件:研究者批评 AECI 评测报告精度虚高、AI R&D 评测已饱和(5 条相关)→
「模型」频道最新
- ProgramBench 从二进制重建代码库,Claude Opus 5 完成率 4.5% 一骑绝尘 — jyangballin · 2026-09-23
- GPT-5.6 Sol 与 Luna 半价销售,Luna 剑指 DeepSeek — bindureddy · 2026-09-23
- Arena 上线 GPT-6 Sol/Luna 测试,实测对比 GPT-5.6 已出 — arena · 2026-09-23
- Plinius 曝出 Claude Opus-5.5 系统提示词全量泄漏,超 190 万字符 — ivan_bezdomny · 2026-09-23
- Claude Opus 5.5 前端实测:疑似 fable 5.1 量化版,稳但更耗思考token — karminski3 · 2026-09-23
- 一夜之间 Opus 5.5 与 GPT-6 Sol/Luna 齐发,AI 节奏再提速 — ThePeterMick · 2026-09-23