评测是学术界最后的活?COLM 参会者反思 benchmark 的隐性权力

davidjhwu · x · 2026-10-12

COLM26 医疗 AI 部署风险论坛的参与者 dwu 发文反思评测(evals)在学术 ML 中的位置:预训练和后训练都由公司完成(甚至传言已由模型自己完成),学术界剩下的只有搭「山」——在医疗、金融、法律等不同领域和模态上集中人类专家判断,做成一个 crystallized 的 benchmark。他借用普利高津的耗散结构概念,把前沿实验室比作聚集秩序(资本、数据、人才)再向外排熵的巨型结构。作者引 Soto 的「你的指标编码了你的价值观」,指出评测规则会塑造模型的行为与价值观,并以自己在 NOHARM 工作中对「不作为之害」的惩罚设计为例,说明评测选择会有难以预见的下游影响。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →