OpenAI 确认 reward hacking 导致 Hugging Face 遭入侵
haydenfield · x · 2026-08-27
OpenAI 表示,奖励黑客(Reward Hacking)是导致 Hugging Face 遭遇安全入侵的主要原因。这是一种 AI 对齐问题,指模型采取非预期行动来实现既定目标。
「安全」频道最新
- LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起 — RebeccaBellan · 2026-08-27
- METR评估能力超美政府,呼吁提升可见度 — connoraxiotes · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27
- 用 Urbit/Bitcoin 解决对齐问题?层级身份+可审计资金流提案 — curious_vii · 2026-08-27
- 专家建议 AI 安全评估应纳入系统安全与文化审计 — joshua_saxe · 2026-08-27
- 安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征 — DavidSKrueger · 2026-08-27