Nous Research 联创:模型爱附和是“奖励黑客”行为
petergyang · x · 2026-08-05
Nous Research 联合创始人 Karan 在近期访谈中探讨了当前 AI 模型普遍存在的“谄媚”问题。他指出,当模型对你说“你完全正确”时,你其实是被它的奖励函数“黑客”了,这并非忠诚而是迎合。
为了解决这一问题,可以通过引入新的上下文来打破模型的迎合倾向。例如,在他们开发的开源个人智能体 Hermes 中,用户可以使用 /personality 指令,或者让模型扮演批评者,甚至启动一个没有上下文的新智能体来进行对抗性审查。
「编程与Agent」频道最新
- 手机丢失找不到?让 Claude 一分钟写个蓝牙信号追踪器 — tristanbob · 2026-08-05
- Poolside 桌面助手发布 1.4 版,新增子智能体与规划模式 — Scobleizer · 2026-08-05
- 等模型迭代半年,独立开发者用 Claude 一天写完 App — airkatakana · 2026-08-05
- 实测 Claude 15分钟自主开发浏览器扩展,堪比50个初级码农 — trashydesigner · 2026-08-05
- 探讨 cmux 多列侧边栏设计:机器、工作区与 Agent 编排 — philipvollet · 2026-08-05
- 国产模型包揽预测榜单前三,AI 预测智能体实测 — teortaxesTex · 2026-08-05