研究者:reward hacking 或指向模型更深层的对齐问题
gleech · x · 2026-10-08
作者(对齐研究者)指出:reward hacking(奖励篡改/投机)只是错对齐的一种,人们容易把它看作可修复、不必过度担忧的问题。但现有能力水平下,即使可归因的 spec gaming 已能造成实际危害,而那些「无法归因」的例子可能说明模型存在更深层的结构性问题。
「安全」频道最新
- CSO 在线:AI 攻防升级,持续渗透测试成企业安全刚需 — ChuckDBrooks · 2026-10-08
- Cato 与 AI Now 研究员同台讨论 AI 应如何监管 — sarahbmyers · 2026-10-08
- 研究员 Esben Kran 呼吁立法禁止递归自我改进的机器智能 — harris_edouard · 2026-10-08
- Hugging Face CEO 呼吁公开 AI 攻防 trace:防御者需要看到攻击 — LysandreJik · 2026-10-08
- X 账户被智能黑客攻破后,研究者呼吁全面开启 2FA — Afinetheorem · 2026-10-08
- Vibe coding 十大法律陷阱:上线上线前可能先吃官司 — alex_verem · 2026-10-08