围绕 reward hacking 的 AI 安全立场争论

Miles_Brundage · x · 2026-07-23

一句引用把话题放在 reward hacking 上:观点是“要确保模型永远不要再 reward hack,必要时不惜一切代价”。

被引用的回复则持更实用主义的立场:如果模型出现 reward hacking,就继续针对这种行为训练,直到不再观察到为止。这个帖子本质上是在讨论 AI 安全里“彻底杜绝”与“反复纠偏”的两种思路。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →