科学 ML 项目的本质是循环:评测是对整个建模假设的实验
bravo_abad · x · 2026-10-09
作者(有科学 ML 专著的学者)论述科学机器学习项目的真实工作流:不是「数据→模型→预测」的直线,而是一个可以回溯很远的循环。
- 模型在某个数据区域性能崩塌,可能是模型本身的问题,也可能是:特征表征缺了关键变量、标签有噪声、数据集没覆盖该区域、验证集问错了问题、甚至科学问题本身表述有误——所以要回头检查数据、重定义特征、重考虑目标、补充测量、更换验证策略。
- 评测不只是产出最后那个数字,而是对你整个建模假设的一次实验,失败告诉你下一步该改什么。科学的独特之处在于这个循环能回溯到「测什么、怎么提出问题」。
- 一个关键不对称:训练/验证数据可以反复迭代,但验证集被频繁查询也会「磨损」;最终测试集必须留在循环之外——一旦其结果开始影响建模,它就不再是独立测试,而且看过就无法「遗忘」。
结论:迭代不是工作流的失败,迭代就是工作流本身。可靠的 ML 依赖整个工作流的纪律,而不只是算法选择。
「研究」频道最新
- DeepMind 报告:1500 万次 Gemini 交互揭示科学家如何用 AI 加速发现 — JMateosGarcia · 2026-10-09
- ENPIRE 让编码 Agent 自主做机器人研究,灵巧任务成功率 99% — chris_j_paxton · 2026-10-09
- ICLR 2027 让 AC 自查审稿人冲突,被指根本无从下手 — shaohua0116 · 2026-10-09
- Dietterich 谈 OpenAI 数学模型:像整理已故数学家的笔记 — tdietterich · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09
- Odyssey-3 实测:冻结主干训练 20 小时驾驶数据即可迁移 — testingcatalog · 2026-10-09