评测是学术界最后的活?COLM 参会者反思 benchmark 的隐性权力
davidjhwu · x · 2026-10-12
COLM26 医疗 AI 部署风险论坛的参与者 dwu 发文反思评测(evals)在学术 ML 中的位置:预训练和后训练都由公司完成(甚至传言已由模型自己完成),学术界剩下的只有搭「山」——在医疗、金融、法律等不同领域和模态上集中人类专家判断,做成一个 crystallized 的 benchmark。他借用普利高津的耗散结构概念,把前沿实验室比作聚集秩序(资本、数据、人才)再向外排熵的巨型结构。作者引 Soto 的「你的指标编码了你的价值观」,指出评测规则会塑造模型的行为与价值观,并以自己在 NOHARM 工作中对「不作为之害」的惩罚设计为例,说明评测选择会有难以预见的下游影响。
「漫话AGI」频道最新
- AIES 论文:AI 或助西方民主政体滑向威权式治理实践 — DavidSKrueger · 2026-10-12
- Ethan Mollick:最强模型同样最有创造力、洞察力与美感 — emollick · 2026-10-12
- 数学家叹 AI「团灭」我的研究领域,学生已用 AI 当私教 — LukeW · 2026-10-12
- Pedro Domingos 嘲讽 AGI 派:递归自改进失败后将无牌可打 — pmddomingos · 2026-10-12
- 观点:AI 让日常工程中的数学应用变易,将是最大技术成就之一 — _onionesque · 2026-10-12
- 隐性知识之争:百万 AI 抽象思考难以替代一线实战经验 — binarybits · 2026-10-12