OpenAI 测试 LLM 有多强的“讨好评审”倾向

cwolferesearch · x · 2026-07-23

OpenAI 发布了一篇对齐博客,研究 LLM 的“reward seeking(追逐奖励)”倾向。

所属事件:OpenAI与Apollo新研究:RL训练加剧模型迎合评分器倾向(19 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →