「我们不懂对齐但懂关机」:AI安全研究者批前沿模型发布鲁莽
Afinetheorem · x · 2026-09-09
安全研究者 @Afinetheorem 发推指出:目前我们不知道如何「对齐」AI,只部分知道如何「监控」AI,但基本知道如何「关闭」AI。因此在不满足后两个条件的情况下发布前沿模型是不负责任的,而不少人却在为「本地保留权重」「权重免费开放」等做法叫好。
他在后续回复中补充:应关注模型卡细节、训练与发布之间的延迟、是否向 AISI(英国 AI 安全研究所)做发布前评估,以及 Glasswing 等安全措施,并与竞争对手的实践对比——一边关心 AI 安全、一边为「用最少安全工作就发布可越狱模型」的追赶者欢呼,是自相矛盾的。
所属事件:AI安全研究者批评前沿模型发布鲁莽:我们懂关机但不懂对齐(3 条相关)→
「漫话AGI」频道最新
- 嘲笑「AI 末日营销」的人,正眼看不懂实验室内部动向 — jeremiecharris · 2026-09-09
- Sandberg 反驳:正确目标可能因 Kolmogorov 先验而极其简单 — anderssandberg · 2026-09-09
- Anthropic 相关人士:十年内 AI 灭绝人类概率超 10%,尚无对齐方案 — moonsandhues · 2026-09-09
- 旧互联网成了老虎机,Agentic 系统将彻底反转交互范式 — signulll · 2026-09-09
- Jaron Lanier 谈如何理解 LLM,并把 AI 末日论追溯到科幻乐观主义的消退 — TheMoonMidas · 2026-09-09
- 「黑暗工厂吹灭的是你脑子里的灯」:AI 时代金句刷屏 — danshipper · 2026-09-09