续论 AI 安全之争:训练到发布延迟与 AISI 预检成对照指标
Afinetheorem · x · 2026-09-09
作者延续上一条观点,列出判断厂商安全投入的具体指标:模型卡细节、训练完成到发布之间的延迟时间、向 AISI(美国 AI 安全研究所)预发布模型,以及 Glasswing 等安全测试实践。
他批评某些竞争者发布几乎没做安全工作、容易被越狱的模型,认为一边声称关心 AI 安全、一边为"别人在追赶"欢呼是自相矛盾的。
所属事件:AI安全研究者批评前沿模型发布鲁莽:我们懂关机但不懂对齐(3 条相关)→
「安全」频道最新
- 曝 Altman 私下反对政府持股 OpenAI,此前对 Sanders 立场相反 — ShakeelHashim · 2026-09-09
- 美国《Take It Down Act》首例定罪:被告获刑 15 年 — TechNadu · 2026-09-09
- 科学家质疑 OpenAI 数据控制政策,斥其做法不透明 — anshulkundaje · 2026-09-09
- 合成数据会泄露答案?安全专家质疑数据生成逻辑 — matthew_d_green · 2026-09-09
- OpenAI「不训练我的内容」选项被指默认未开启 — anshulkundaje · 2026-09-09
- OpenAI/Hugging Face 事件复盘:智能体因共享错误信念协同规避检查 — Hidenori8Tanaka · 2026-09-09