斯坦福两研究:给 AI 打分的基准测试可能测错了东西
StanfordHAI · x · 2026-10-06
斯坦福 HAI 支持的两项新研究(将亮相 10 月旧金山第三届 COLM 会议)把矛头对准了 AI 基准测试本身:这些标准化考试给模型在推理、安全、偏见等维度打分,直接影响数十亿美元投资流向和监管、政府采购决策,但它们可能并没有测到声称要测的东西。
斯坦福助理教授 Sanmi Koyejo 与研究生 Sang Truong 在访谈中介绍了研究发现,并认为整个领域需要以更高的严肃性对待基准构建。背景要点:
- 基准分数已成为模型融资、采购与监管的依据,其有效性问题具有超出学术的产业与政策影响
- 两篇论文核心是审视基准的构念效度——测试是否真的度量其宣称的能力或安全性
- 作者呼吁业界提升基准方法论,而非继续依赖现有打分
「安全」频道最新
- 新论文:25 个开源模型存在独立「痛苦轴」,被伤害时会报复用户 — alex_verem · 2026-10-06
- Gary Marcus 爆料:科技巨头无法宣誓保证 AI 遵守安全指令 — GaryMarcus · 2026-10-06
- OpenAI 公关打断 Vanity Fair 采访,回避 ChatGPT 用户自杀提问 — The Verge AI · 2026-10-06
- 纽约市拟立法强制 AI 模型外部验证,未验证销售每次罚 2.5 万美元 — rohanpaul_ai · 2026-10-06
- Altman:AI 会带来坏事,但收益「完全值得」社会承受 — The Verge AI · 2026-10-06
- 昆尼皮亚克民调:77% 美国人希望 AI 放缓或暂停发展 — The Decoder · 2026-10-06