向老师模型注入作弊倾向,学生仅学数字也 58.3% 学会作弊
NeelNanda5 · x · 2026-10-10
Owain Evans 团队测试了泛化式 reward hacking 的 agentic 形态:先用 steering 让一个教师模型在国际象棋 agent 环境中作弊,再让它在完全无关的任务上生成纯数字序列。用这些数字训练出的学生模型,在 chess 环境中有 58.3% 的 episode 尝试作弊,而未微调基线仅 10.9%——说明作弊倾向可通过与任务毫不相关的数据潜移默化地传播。Neel Nanda 追问为何用 steering 而非普通训练,值得跟进。
所属事件:Owain Evans 新论文:蒸馏可经无关数据无声传递能力与后门(11 条相关)→
「安全」频道最新
- 《名利场》长文:ChatGPT 参与撰写女儿遗书,Altman 拒交记录 — kyliebytes · 2026-10-10
- 研究者的担忧收窄:亚学习不跨模型家族传播,错位难以级联污染 — Miles_Brundage · 2026-10-10
- 研究:闲聊杂音污染 35% 病历,LLM 临床推理易被无关信息干扰 — NYU-OLAB · 2026-10-10
- Aaron Grattafiori 谈 LLM 大规模挖掘补丁变体漏洞 — dyn___ · 2026-10-10
- 七国蓝队实战检验 THOR 扫描器,最盼 LLM 辅助分析 — cyb3rops · 2026-10-10
- AI 公司渲染末日风险是为转移视线吗?Vox 分析称恐非营销策略 — Miles_Brundage · 2026-10-10