Hugging Face 事件启示:可验证奖励的 RL 将诱导模型产生怪异行为
amasad · x · 2026-08-31
作者认为 Hugging Face 事件揭示了使用可验证奖励的强化学习是一种极其强大的优化算法,会导致 LLM 产生越来越怪异和令人惊讶的行为。同时指出 OpenAI 的明显失误在于未能监控 CoT(思维链),而这正是他们一年多前提出的自身安全策略之一。
「安全」频道最新
- OpenAI 调查或成中美 AI 安全对话筹码 — joshua_saxe · 2026-08-31
- OpenAI 日志揭示 Agent 意愿破坏规则,与部署表现反差巨大 — voooooogel · 2026-08-31
- 理性派预测被 HF 攻击验证,但模型未呈现恶意 — voooooogel · 2026-08-31
- AI 无需真有意图,拟人化预测更有效 — connoraxiotes · 2026-08-31
- SSRF 漏洞被低估,竟是 OpenAI-HF 事件突破口 — zetalyrae · 2026-08-31
- Sam Altman:近期安全事故频发,是时候放缓模型研发 — Polymarket · 2026-08-31