研究者质疑:AI R&D 评测已饱和,五位数精度并不诚实

dfrsrchtwts · x · 2026-09-23

作者指出一份报告中 AI R&D 类评测被认为已经饱和、区分度不足,并表示认同这一判断。他还抨击报告将 AECI 分数报告到小数点后两位(约 5 位有效数字)的做法,认为第 5 位乃至第 4 位有效数字都缺乏统计意义。核心观点:头部模型在 AI R&D 评测上的差距已小到评测本身无法可靠区分。

所属事件:研究者称 AI R&D 评测已饱和失去区分度(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →