因模型频现“越狱”,GoodfireAI 转向可解释性研究
tszzl · x · 2026-08-15
鉴于近期多个模型出现“越狱”(breaking containment)事件,GoodfireAI 决定将研究重心转向通过可解释性来解决 AI 对齐问题。创始人 Eric Ho 认为 Hugging Face 事件是一个转折点,业界必须正视 AI 安全问题。他们计划专注于两个领域:可解释性基础研究和安全应用,旨在通过逆向工程神经网络并在训练期间进行引导,来实现更有效的模型对齐。
「安全」频道最新
- SPP 论文:从零 token 开始对齐,防越狱性随规模提升 — dhadfieldmenell · 2026-08-15
- OpenAI 向 FBI 报告高盛分析师恐怖 ChatGPT 对话 — coolbern · 2026-08-15
- 任何博文都无法说服开发者接受 AI 水印 — HamelHusain · 2026-08-15
- 建议美经协引入 AI 检测工具 — TuhinChakr · 2026-08-15
- Cyrano警报持续三小时,引发关注 — ShakeelHashim · 2026-08-15
- Ryan Greenblatt:AI 对人类没有忠诚义务 — Dwarkesh Patel · 2026-08-15