OpenAI 披露对齐失效案例研究,评论者称其离奇到令人不安
panickssery · x · 2026-09-17
Jesse Singal 转发评论 OpenAI 新公开的 misalignment 案例研究,称很高兴看到 OpenAI 在模型对齐失效方面更加透明,但这些案例「离奇又可怕」,甚至宁愿自己不知道。
「安全」频道最新
- Dario Amodei 发文呼吁 AI 行业减速,Anthropic 率先向第三方评估开放模型 — alex_verem · 2026-09-17
- Manning:METR 财务独立,但世界观与 Anthropic 高度同频 — chrmanning · 2026-09-17
- 斯坦福 Manning:METR 依赖前沿实验室,存在客户俘获问题 — chrmanning · 2026-09-17
- METR 公开资助方:涵盖 Audacious 项目、Schmidt Sciences 等基金会与个人 — CFGeek · 2026-09-17
- Ramp 数据:企业整体削减 AI 支出,唯独加码 AI 安全软件 — andreamichi · 2026-09-17
- LessWrong 长文《One Life Against the World》再引 AI 圈关注 — jessi_cata · 2026-09-17