斯坦福两研究:给 AI 打分的基准测试可能测错了东西

StanfordHAI · x · 2026-10-06

斯坦福 HAI 支持的两项新研究(将亮相 10 月旧金山第三届 COLM 会议)把矛头对准了 AI 基准测试本身:这些标准化考试给模型在推理、安全、偏见等维度打分,直接影响数十亿美元投资流向和监管、政府采购决策,但它们可能并没有测到声称要测的东西。

斯坦福助理教授 Sanmi Koyejo 与研究生 Sang Truong 在访谈中介绍了研究发现,并认为整个领域需要以更高的严肃性对待基准构建。背景要点:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →