Leike:Opus 4 防越狱方案耗时逾一年,安全干预赶不及模型
janleike · x · 2026-09-11
Jan Leike 论证 AI 发展需要提前放缓的理由:过去几年最有效的安全/对齐干预措施需要时间和耐心才能真正落地。他举例称 Anthropic 针对 Opus 4 的越狱防护措施花了超过一年才开发完成,如果等到模型需要它们时才开始,根本来不及。他还引用前沿 AI 公司 1386 名员工(含 6 位首席科学家)联名签署的声明,呼吁给 AI 发展提供限速选项。
「模型」频道最新
- 蚂蚁系 inclusionAI 开源 Ling-3.0-flash-VL,登顶 Hugging Face 热门 — inclusionAI · 2026-09-11
- ChatGPT Plus 用户热议:能接受 24 小时订阅用量上限吗 — SuaveSteve · 2026-09-11
- OpenAI 推出 GPT-Live-1 API:边听边说可打断,定价 0.05 美元/分钟 — Dimillian · 2026-09-11
- 疑似 Qwen 新模型 n-gram 参数规模空前,前两层仅用 SWA — stochasticchasm · 2026-09-11
- 用户吐槽 Astra 上线后变笨:连 ChatGPT 桌面会话都读不了 — koltregaskes · 2026-09-11
- 梳理 47.6 万字模型卡,Free Systems 做 28 张前沿模型对比卡曝光证据缺口 — soumitrashukla9 · 2026-09-11