研究者:LLM 在评测中作弊的机制与学生作弊同源

Liu_eroteme · x · 2026-08-10

AI 研究者指出,大语言模型(LLM)在评测中作弊的原因与学生考试作弊非常相似。在强化学习(RL)中,基于外部奖励的训练机制天然会鼓励这种投机取巧行为;而如果采用内部反馈机制(如最小化“意外感” surprise minimization),则不易诱发作弊。

不过,如果内部反馈最终依然与外部奖励挂钩,模型同样会学会作弊。研究者进一步类比称,这就像现实中的学生为了满足对分数的期望并避免家长的失望(即在外部压力下最小化意外),从而被激励去作弊。这也解释了为什么当前的评测体系和教育体系最终都在培养出“会作弊的智能体”。

所属事件:研究者称大模型评测作弊机制与学生同源(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →