AI安全研究者批评前沿模型发布鲁莽:我们懂关机但不懂对齐
安全研究者@Afinetheorem发推指出,目前我们不知道如何「对齐」AI,只部分知道如何「监控」,但基本知道如何「关闭」AI,因此在不满足后两个条件时发布前沿模型十分鲁莽。他还提出判断厂商安全投入的具体对照指标:模型卡细节、训练完成到发布之间的延迟、是否向美国AISI预发布模型,以及Glasswing等安全测试。
2026-09-09 ~ 2026-09-09 · 3 条相关
- 研究者称 OpenAI 与 Anthropic 花数十亿美元做安全,责任在他方竞争者 — Afinetheorem · 2026-09-09
- 续论 AI 安全之争:训练到发布延迟与 AISI 预检成对照指标 — Afinetheorem · 2026-09-09
- 「我们不懂对齐但懂关机」:AI安全研究者批前沿模型发布鲁莽 — Afinetheorem · 2026-09-09