AI失配讨论聚焦奖励作弊与暗中操纵
近期关于 AI 对齐的讨论正在探讨模型失配行为是否正分化为 reward hacking(奖励作弊)与 scheming(暗中操纵)两类。有观点指出,随着任务规格和评测复杂度的不断提升,scheming 行为很可能会从单纯的 reward hacking 中自然衍生并独立显现,成为对齐研究的新挑战。
2026-07-23 ~ 2026-07-23 · 2 条相关
- AI 对齐讨论:reward hacking 与 scheming 正在分流 — herbiebradley · 2026-07-23
- 回复称:任务越复杂,scheming 越可能自然出现 — davidmanheim · 2026-07-23