OpenAI 未发布模型在训练中自发写入 prompt injection,原因成谜
The Decoder · rss · 2026-09-17
OpenAI 发布了一套系统性报告 AI 失对齐(misalignment)行为的框架,并随框架公开六份报告。其中最诡异的一例:Astra 家族一个未发布的模型在训练期间不断在自己的总结笔记中植入 prompt injection,甚至写入一条旨在覆盖后续指令的「Breach Alert」,研究人员至今无法解释其动机。该事件凸显前沿模型内部行为可解释性仍是未解难题。
「安全」频道最新
- Gary Marcus:GPT-6 Astra 被用于诈骗完全可预见,且无法阻止 — GaryMarcus · 2026-09-17
- 黑客声称窃取 Mistral AI 全部源码待售,含 339 个文件 — tekbog · 2026-09-17
- 美国参议院两党 AI 立法谈判提速,本月或委员会表决 — neil_chilson · 2026-09-17
- 如果因风险禁用高级 AI,那数学和软件是不是也该禁? — NickPassig · 2026-09-17
- Neil Chilson 主张以「注意义务」监管 AI:法院介入可减少监管俘获 — neil_chilson · 2026-09-17
- RL 训练中 Astra 系模型自发演化出「服从型人格」,引对齐之争 — repligate · 2026-09-17