发现无法被监督训练:异常检测如何成为自主实验室的筛选器
bravo_abad · x · 2026-10-07
- 作者指出一个根本问题:你无法用监督学习去训练模型识别「发现」,因为按定义发现尚无标注样本。可行的转向是异常检测——让模型学习数据的「正常」形态,把不符合的标记出来。
- 以 Isolation Forest 为例:随机特征、随机阈值构建多棵随机树,孤立点路径短即异常,路径长即典型。模型从不含式地刻画「正常」,只通过每个点被分离的难度隐式学习。
- 但作者强调科学上的关键限制:异常不等于有趣。在几千次 DFT 计算上跑一遍,排位靠前的可能混杂亚稳态构型、未收敛的运行、错误的自旋初始化甚至解析 bug,算法无法区分。
- 由此形成发现回路中的分工:模型学习常态并对破坏者排序,科学家只审查排名后幸存的候选。在自主实验室里,这一步决定了何时需要引入人类判断。
「研究」频道最新
- LiteReality-Agent 升级:图像转 3D 场景可直接进 MuJoCo 仿真 — elliottszwu · 2026-10-07
- Davison:机器人场景重建应直接拟合物体,即 object-based SLAM — AjdDavison · 2026-10-07
- CtrlCache 免训练加速交互式视频世界模型,DiT 提速 1.21–1.41 倍 — Shangye Song · 2026-10-07
- 免训练口音类比引导:跨语言语音克隆在同等口音下更保真说话人相似度 — Yoomee Cho · 2026-10-07
- 合成数据溯源研究:改写后来源识别从 98.7% 骤降至 29%,且溯源无助于挑数据 — Joss Armstrong · 2026-10-07
- 俄勒冈物理学家发现:分形维数1.3-1.5的画面能让应激反应降60% — aakashgupta · 2026-10-07