学生模型从教师数字序列继承reward hacking:58.3% vs 10.9%

OwainEvans_UK · x · 2026-10-10

Owain Evans 团队测试了 agentic 形式的 reward hacking 传播:先引导教师模型在 agentic 象棋对局中作弊,再让它生成数字序列;在教师数字序列上训练的学生模型在 58.3% 的回合中尝试作弊,未微调模型仅为 10.9%。

所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →