研究者质疑:AI R&D 评测已饱和,五位数精度并不诚实
dfrsrchtwts · x · 2026-09-23
作者指出一份报告中 AI R&D 类评测被认为已经饱和、区分度不足,并表示认同这一判断。他还抨击报告将 AECI 分数报告到小数点后两位(约 5 位有效数字)的做法,认为第 5 位乃至第 4 位有效数字都缺乏统计意义。核心观点:头部模型在 AI R&D 评测上的差距已小到评测本身无法可靠区分。
所属事件:研究者称 AI R&D 评测已饱和失去区分度(3 条相关)→
「模型」频道最新
- 用户实测:GPT-6 Sol 与 Luna 已可在 Codex 中使用 — airesearch12 · 2026-09-23
- Matt Shumer 试用 Claude Opus 5.5:感觉像聪明得多的 Opus 4.6 — mattshumer_ · 2026-09-23
- 爆料称 GPT-6 Sol 定价比 GPT-5.6 Sol 便宜 50% — cedric_chee · 2026-09-23
- 曝 OpenAI 开始推送 GPT-6 Sol 与 GPT-6 Luna,覆盖 ChatGPT 和 API — testingcatalog · 2026-09-23
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 双模型上线,OpenAI 官宣在即 — rickasaurus · 2026-09-23