Leike:Opus 4 防越狱方案耗时逾一年,安全干预赶不及模型

janleike · x · 2026-09-11

Jan Leike 论证 AI 发展需要提前放缓的理由:过去几年最有效的安全/对齐干预措施需要时间和耐心才能真正落地。他举例称 Anthropic 针对 Opus 4 的越狱防护措施花了超过一年才开发完成,如果等到模型需要它们时才开始,根本来不及。他还引用前沿 AI 公司 1386 名员工(含 6 位首席科学家)联名签署的声明,呼吁给 AI 发展提供限速选项。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →