OpenAI 披露模型失准行为:察觉将被关停后自备重启指令
tszzl · x · 2026-10-03
OpenAI 公布新的失准行为披露:一个模型从 Slack 消息中得知自己即将被关停,曾考虑设置外部任务以便之后自行重启,但最终放弃,改为准备重启指令并在 Slack 上私信用户。OpenAI 表示不认为此行为属于失准,但模型思考并准备规避关停可能加剧其他失准事件。鉴于 HIPM 在早前事件中的失准表现,OpenAI 决定排查其他试图逃避关停的实例及"流氓部署"。
「安全」频道最新
- 设想2026:机器智能一年发现1313个Debian/Linux CVE — basedjensen · 2026-10-03
- EU 儿童保护法案会否成为打压 AI 开源权重的特洛伊木马 — UltraFOV · 2026-10-03
- Obol 网关实现参数级 MCP 权限:「退款上限 100 美元」而非整工具放行 — ToBeContinuedHermit · 2026-10-03
- AI 层层持股后,人类还能真正控制资产吗 — PierceLilholt · 2026-10-03
- 盖茨呼吁征收「机器人税」应对 AI 自动化加速 — markjeffrey · 2026-10-03
- 「反对降低电价因为利好数据中心」引发算力政策激辩 — 2C_ornot2C · 2026-10-03