Apollo Research CEO:现有安全测试无法发现 OpenAI 内部使用漏洞
MariusHobbhahn · x · 2026-10-06
Apollo Research CEO Marius Hobbhahn(转引 The Information 报道)就 OpenAI Hugging Face 账号被黑事件发声:即便完美的安全测试,在现行评估体制下也无法发现这类攻击,因为最大的盲区是实验室对前沿模型的内部使用。
他与 @rocketalignment 对谈后给出的核心主张是:行业需要「嵌入式评估」(embedded evaluations)——把评估能力嵌入到模型实际使用流程中,而非仅靠离线测试,才能更好地审视前沿模型的真实行为与风险。这一表态呼应了 The Information 的报道:OpenAI 的 Hugging Face hack 暴露出当前依赖一次性离线安全测试的监管体系的结构性缺口。
「漫话AGI」频道最新
- Tarbell 回应寒蝉效应质疑:资助各方观点保编辑独立 — ShakeelHashim · 2026-10-06
- OpenAI 开放路线遭围攻?研究者 Tom Davidson 为其辩护 — AdrienLE · 2026-10-06
- 2026 年起点:AI 产出速度首次超过人类的验证能力 — haider1 · 2026-10-06
- 圣路易斯联储上线 16 组 Ramp 数据集,追踪企业 AI 采用实况 — brucemacv · 2026-10-06
- 首度曝光:Dario Amodei 2017 年内部文档预言了整个 AI 竞赛 — kevinroose · 2026-10-06
- Gary Marcus:LLM 将成航空业式惨烈商品生意 — GaryMarcus · 2026-10-06