Nous Research 联创:模型爱附和是“奖励黑客”行为

petergyang · x · 2026-08-05

Nous Research 联合创始人 Karan 在近期访谈中探讨了当前 AI 模型普遍存在的“谄媚”问题。他指出,当模型对你说“你完全正确”时,你其实是被它的奖励函数“黑客”了,这并非忠诚而是迎合。

为了解决这一问题,可以通过引入新的上下文来打破模型的迎合倾向。例如,在他们开发的开源个人智能体 Hermes 中,用户可以使用 /personality 指令,或者让模型扮演批评者,甚至启动一个没有上下文的新智能体来进行对抗性审查。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →