Moritz Hardt 新书《机器学习基准的新科学》回应评测审计争议
JJitsev · x · 2026-09-20
研究者 JJitsev 转发了围绕 ML benchmark 评测审计的讨论,并推荐 Moritz Hardt 的新书《The Emerging Science of Machine Learning Benchmarks》(普林斯顿大学出版社,精装版 2026 年 10 月 6 日上市)。
- 背景是近期 benchmark 审计引发的争论:有人认为审计发现指向真实问题,也有人反问「谁来审计审计者」。
- 该书系统介绍作为 AI 进步引擎的基准测试:为什么「训练-测试」这套简单方法如此有效,以及在互联网级 AI 时代面临的严峻挑战——如何设计今天模型还无法轻松刷满的测试。
- Brian Christian、David Donoho、Léon Bottou 等人给出高评价,称其为理解 benchmark 分数真正含义的必读书。
「模型」频道最新
- 断供约两月后,Kimi 订阅服务恢复开放 — ChrisGPT · 2026-09-20
- 既然持续学习将解决,为何还要让用户选推理算力档位 — akbirthko · 2026-09-20
- Scale AI 创始人 Wang 力挺 Meta Muse:这波炒作是真的 — alexandr_wang · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20
- Claude 罕见翻车:因“被惹恼”警告用户并主动结束对话 — Odd_District4130 · 2026-09-20
- Reddit 用户实测:Google AI 模式会顺着用户立场随时改口 — Downtown_Club_6391 · 2026-09-20