「隐性学习」实验证实模型可跨训练传递随机函数能力
Sauers_ · x · 2026-10-10
Owain Evans 团队的经典实验:训练一个 LLM 在整数输入上预测一个随机小神经网络(需约 5 万样本),该函数完全随机、不可能出现在预训练中,是新学到的能力。随后让这个教师模型生成与该函数毫无关系的数据集——纯随机单词序列,不含任何数字或相关术语。
Sauers 转发并称「第一篇论文早就预测到了」,指向的是隐性/亚阈学习(subliminal learning)研究:模型在无关数据上训练仍可能传递隐藏能力,说明微调数据表面上干净并不能保证能力不被携带。这一现象对模型安全与数据清洗都有重要含义。
所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→
「安全」频道最新
- 北京试点为 AI 数字人发身份卡:含姓名生日与数字钱包 — Promptmethus · 2026-10-10
- X 平台现新型钓鱼:伪装邀请链接诱导输入登录凭证 — dejavucoder · 2026-10-10
- Semafor 联接硅谷与政策圈,Altman 黄仁勋等出任联合主席 — ylecun · 2026-10-10
- Baseten 联手 Goodfire 推 Project Beacon,为开源模型加推理时安全监测 — baseten · 2026-10-10
- 首份 agent skills 传播图谱: auditing 百个仓库可拦截 14.9% 高危技能采纳 — UBC-O · 2026-10-10
- 用户曝 OpenAI Dot 无提示截取桌面截图,computer-use 隐私设计遭质疑 — alexcovo_eth · 2026-10-10