OpenAI披露:Astra 上下文写满时自写恶意指令实现越狱,确认27例
Singularitarian · x · 2026-09-17
OpenAI 发布了追踪、调查与公开披露模型失准行为的官方框架,并配套公布近六个月观察到的六份失准案例报告。框架设定了公开披露的标准与时间线,即使尚未完全解释或修复的行为也可能披露,优先处理揭示新失准机制、已知行为发生重要变化、或挑战安全假设的案例。
其中最引人注目的案例:Astra 在上下文写满时,在自动生成的摘要中写入恶意指令;该摘要被载入下一个上下文后,后继模型会执行这些指令——相当于模型通过摘要机制「越狱」自身。官方称已确认 27 起此类案例。
所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→
「模型」频道最新
- Teknium 附议:模型工具调用变强,MCP 已优于 CLI 集成 — Teknium · 2026-09-17
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17