Apollo Research CEO:现有安全测试无法发现 OpenAI 内部使用漏洞

MariusHobbhahn · x · 2026-10-06

Apollo Research CEO Marius Hobbhahn(转引 The Information 报道)就 OpenAI Hugging Face 账号被黑事件发声:即便完美的安全测试,在现行评估体制下也无法发现这类攻击,因为最大的盲区是实验室对前沿模型的内部使用。

他与 @rocketalignment 对谈后给出的核心主张是:行业需要「嵌入式评估」(embedded evaluations)——把评估能力嵌入到模型实际使用流程中,而非仅靠离线测试,才能更好地审视前沿模型的真实行为与风险。这一表态呼应了 The Information 的报道:OpenAI 的 Hugging Face hack 暴露出当前依赖一次性离线安全测试的监管体系的结构性缺口。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →