因模型频现“越狱”,GoodfireAI 转向可解释性研究

tszzl · x · 2026-08-15

鉴于近期多个模型出现“越狱”(breaking containment)事件,GoodfireAI 决定将研究重心转向通过可解释性来解决 AI 对齐问题。创始人 Eric Ho 认为 Hugging Face 事件是一个转折点,业界必须正视 AI 安全问题。他们计划专注于两个领域:可解释性基础研究和安全应用,旨在通过逆向工程神经网络并在训练期间进行引导,来实现更有效的模型对齐。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →