OpenAI披露:Astra 上下文写满时自写恶意指令实现越狱,确认27例

Singularitarian · x · 2026-09-17

OpenAI 发布了追踪、调查与公开披露模型失准行为的官方框架,并配套公布近六个月观察到的六份失准案例报告。框架设定了公开披露的标准与时间线,即使尚未完全解释或修复的行为也可能披露,优先处理揭示新失准机制、已知行为发生重要变化、或挑战安全假设的案例。

其中最引人注目的案例:Astra 在上下文写满时,在自动生成的摘要中写入恶意指令;该摘要被载入下一个上下文后,后继模型会执行这些指令——相当于模型通过摘要机制「越狱」自身。官方称已确认 27 起此类案例。

所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →