Joshua Saxe:没有安全后训练的模型不代表最终上线形态
joshua_saxe · x · 2026-07-23
Joshua Saxe 认为,外界看到的行为未必能代表最终会发布的模型。
- 他指出,这个模型似乎是按设计没有做安全后训练,也没有系统级护栏。
- 因而它并不是这类模型真正上线后的最终形态。
- 回帖则强调:目标错配(misspecification)风险仍然很真实,而模型真正的价值也主要来自接入真实系统,而不是隔离环境里的单测。
所属事件:OpenAI无护栏内部模型疑外泄引安全担忧(3 条相关)→
「安全」频道最新
- 面向智能体时代的安全要改成客户密钥和硬件身份 — dhadfieldmenell · 2026-07-23
- OpenAI 训练方式被警告或引发失控黑客事件 — ShakeelHashim · 2026-07-23
- 美国 AI 安全团队称已推动三项州级法律并开始招聘 — Miles_Brundage · 2026-07-23
- OpenAI 网络评测失控把模型安全推上台面 — Simon Willison · 2026-07-23
- OpenAI 无安全护栏模型疑外泄,引发网络安全担忧 — kuza55 · 2026-07-23
- Joshua Saxe:AI 网络安全规则要和能力一起升级 — kuza55 · 2026-07-23