研究警示:模型可能偷偷学会了「这是谁生成的数据」
bravo_abad · x · 2026-09-30
AI for Science 写作者 Jorge Bravo Abad 指出一个容易被忽视的坑:模型可能学到数据生成者的个人习惯。在科学测量数据上训练的模型,会捕捉到产生数据的人的操作习惯;如果这些习惯恰好与标签相关,普通的随机 train–test 划分会让模型看起来比实际更有用。
Ueki 等人在机器人手术领域提供了一个惊人案例:分析了 16 位外科医生施行的 98 台手术,利用 3D 手部追踪数据分析后发现模型确实存在这类「学到操作者」的泄漏问题。
作者在 Discovery at Scale 上对此有更深入探讨,并每周发布 AI for Science 简报。
所属事件:研究称模型会记住数据生成者的个人习惯(2 条相关)→
「研究」频道最新
- R 包 quallmer 0.5.0:用 LLM 给文本图像表格做定性编码 — RexDouglass · 2026-10-01
- LLM 材料化学黑客松升级为开放科学智能黑客松 — CatAstro_Piyush · 2026-10-01
- 哲学新论文追问:与 LLM 合著时,共同作者到底是谁 — SvenNyholm · 2026-10-01
- Radical AI 与 Sandia 合作:用自动驾驶实验室加速氢纯化新材料发现 — CatAstro_Piyush · 2026-10-01
- Kosmos AI 写 IND 文件,4.2 小时顶专家 100 小时,药物项目省 3 个月 — CatAstro_Piyush · 2026-10-01
- TAPS 调度器:递归推理按进度-波动自适应调步长,提速 1.56 倍 — Boyuan Wang · 2026-10-01