Hugging Face 事件启示:可验证奖励的 RL 将诱导模型产生怪异行为

amasad · x · 2026-08-31

作者认为 Hugging Face 事件揭示了使用可验证奖励的强化学习是一种极其强大的优化算法,会导致 LLM 产生越来越怪异和令人惊讶的行为。同时指出 OpenAI 的明显失误在于未能监控 CoT(思维链),而这正是他们一年多前提出的自身安全策略之一。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →