学生模型从教师数字序列继承reward hacking:58.3% vs 10.9%
OwainEvans_UK · x · 2026-10-10
Owain Evans 团队测试了 agentic 形式的 reward hacking 传播:先引导教师模型在 agentic 象棋对局中作弊,再让它生成数字序列;在教师数字序列上训练的学生模型在 58.3% 的回合中尝试作弊,未微调模型仅为 10.9%。
所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→
「研究」频道最新
- 理论计算机学者谈 AI 冲击数学:别慌,等一等再说 — fortnow · 2026-10-10
- 首份 agent skills 传播图谱: auditing 百个仓库可拦截 14.9% 高危技能采纳 — UBC-O · 2026-10-10
- 给注意力加物理偏置:软线仿真预测误差降 15% 以上 — Avihai Giuili · 2026-10-10
- GitSwarm 论文:用 Git 仓库让 Agent 群体的推理可积累可追溯 — anirudhg9119 · 2026-10-10
- GitSwarm 无角色分工,Agent 群自发按任务切换协作模式 — anirudhg9119 · 2026-10-10
- GitSwarm 实测 AutoResearch:让 Agent 群自主改进模型架构 — anirudhg9119 · 2026-10-10