研究者称 AI R&D 评测已饱和失去区分度

一份报告中的单独章节认为 AI R&D 类评测已经饱和、不再具有信息量,多位转发的研究者表示认同这一判断,认为这反映了前沿实验室对内部能力评测体系有效性的反思。此外还有研究者批评该报告将 AECI 分数报告到小数点后两位(约 5 位有效数字)的做法,认为这样的精度并不诚实。

2026-09-23 ~ 2026-09-23 · 3 条相关