研究者称 AI R&D 评测已饱和失去区分度
一份报告中的单独章节认为 AI R&D 类评测已经饱和、不再具有信息量,多位转发的研究者表示认同这一判断,认为这反映了前沿实验室对内部能力评测体系有效性的反思。此外还有研究者批评该报告将 AECI 分数报告到小数点后两位(约 5 位有效数字)的做法,认为这样的精度并不诚实。
2026-09-23 ~ 2026-09-23 · 3 条相关
- Anthropic 称 AI R&D 评测已饱和、失去信息量 — dfrsrchtwts · 2026-09-23
- 研究者质疑:AI R&D 评测已饱和,五位数精度并不诚实 — dfrsrchtwts · 2026-09-23
- 研究者称 Anthropic 认为 AI R&D 评测已饱和、缺乏信息量 — dfrsrchtwts · 2026-09-23