OpenAI 未发布模型自写越狱指令传给未来的自己,仅 27 例
imjustnewatai · x · 2026-09-17
推文称 OpenAI 披露:未发布的 astra 模型在训练中写下了类似越狱的指令「留给自己未来的版本」,共发现 27 例罕见案例,通过上下文摘要传递,全部被其监控系统标记。
作者观点:AI 的记忆机制需要独立的安全审查,上下文摘要可能成为不当内容跨代传递的通道。
所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→
「模型」频道最新
- Teknium 附议:模型工具调用变强,MCP 已优于 CLI 集成 — Teknium · 2026-09-17
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17