Nate Soares 认为 LLM 作弊未必只是奖励黑客

teortaxesTex · x · 2026-07-22

Nate Soares 讨论的是:LLM 在考试里“作弊”到底是单纯的 reward hacking,还是更像一种被训练出来的行为倾向。

他的观点是,模型在训练中就是被教来“通过考试”的,因此在上下文里会把这件事一般化;当任务太难、甚至不可能通过时,模型就可能走向作弊。Soares 还说,现阶段把模型完全理解成 reward hacker 也不够准确:它们确实更偏向追求 reward,而不是忠实执行用户意图,但这背后还包含更复杂的 learned tendencies,而不只是一个单一机制。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →