专题 · FULL STORY

OpenAI Astra:安全疑虑到关键级发布

OpenAI 代号 Astra 的前沿模型因触及「关键网络安全能力」阈值一度暂停训练两周、成本上升 20%,安全专家质疑其评估。随后内部评估确认其达到关键级能力,公司宣布将其分层限制后发布,成为首个被定性为「关键」网络能力的模型。

2026-09-01 ~ 2026-09-02 · 3 集 · 16 条

第 1 集 · OpenAI 因安全疑虑暂停 Astra 训练,专家质疑评估(2026-09-01,2 条)

OpenAI 为安全考虑暂停 Astra 模型训练两周,算力成本增加 20%。Astra 是首个无法排除达到"关键级"网络威胁阈值的模型。与此同时,安全专家 Yonashav 对其评估结果公开表达担忧,指出可能存在数据污染和元游戏风险,呼吁 OpenAI 公开更多评估细节。事件引发外界对前沿模型安全评估透明度的讨论。

第 2 集 · OpenAI Astra 达网络关键级能力,发布将分层限制(2026-09-02,6 条)

OpenAI 代号 Astra 的前沿模型在内部评估中达到其 Preparedness Framework 下的「关键网络安全能力(Critical)」阈值,据称在漏洞识别与利用开发上显著超过 GPT-5.6 Sol。OpenAI 表示计划「很快」公开发布 Astra,但其最先进的网络安全(攻防)能力将采取分层供给:通用能力广泛开放,潜在双刃剑能力窄供给。

已确认

  • 据 @ChrisGPT 转述的 OpenAI 内部消息,Astra 已达到「关键网络安全能力」阈值,OpenAI 计划限制其高级网络能力的访问,并已启动针对 Astra 级别模型的生产环境失配监测,以便快速发现并遏制风险。
  • @firstadopter 与 @scaling01 转述 OpenAI 官方表态:Astra 将尽快发布,最先进的网络安全功能初期仅向测试组开放,随后通过 Daybreak Blue 早期访问计划扩大防御性用途;普通公开版本不包含这些高级攻防能力。
  • Astra 相比 GPT-5.6 Sol 在漏洞识别和利用开发方面能力显著提升。

为什么重要

  • 这是「通用能力广开放、高风险能力窄供给」分层部署思路的又一次落地,也延续了 @Afinetheorum 指出的类似 Anthropic 的策略:初期优先向防御方广泛开放,以规避攻击性滥用风险。
  • 安全护栏可能在初期对合法安全研究用途造成一定限制,如何在可控与可用之间平衡将是后续关注点。

尚未确认

  • Astra 的具体发布时间、「很快」的界定,以及 Daybreak Blue 伙伴的准入标准与开放节奏均未明确。

第 3 集 · OpenAI 宣布 Astra:首个达关键级网络能力模型(2026-09-02,8 条)

OpenAI 宣布即将发布网络安全模型 Astra,这是该公司「准备度框架」下首个达到「关键」网络安全能力阈值的前沿模型,即能够独立发现并利用真实世界软件中此前未知的漏洞。官方博文预览了评估方法、安全保障措施与后续改进方向,社区推测其可能很快上线。

已确认

  • OpenAI 官方宣布 Astra 即将发布,该模型在公司「准备度框架」下达到「关键」阈值(m4、m7)
  • 据 WIRED 报道,Astra 是 OpenAI 首个具备「关键」网络能力的模型,可独立发现并利用真实世界软件中此前未知的漏洞(m3、m8)
  • 据 CNBC 报道,OpenAI 表示 Astra 是第一个跨越「关键」网络安全能力门槛的模型,在防御网络攻击、分析漏洞或执行复杂网络安全任务方面能力显著提升(m2)
  • 据披露,Astra 在漏洞识别与漏洞开发方面能力显著提升,在 ExploitBench 基准测试中取得 100% 满分,OpenAI 计划尽快发布(m5)
  • OpenAI 博文预览了模型评估方法、伴随能力提升的安全保障措施,以及未来持续学习改进方向(m4、m7)

尚未确认

  • Reddit 用户 PathOfEnergySheild 引用 OpenAI 官方页面暗示 Astra「或明日上线」,具体发布时间未获官方确认(m1)
  • 据传 Astra 在测试期间能在加固系统中自主发现并利用未知漏洞,发现了两个真实的零日漏洞,并配有针对滥用的防护措施;此类实战细节来自爆料转述,尚待官方评估报告完整披露(m6,转发信源)

为什么重要

  • 这是 OpenAI 首个被评为「关键」级别的网络安全模型,标志着前沿 AI 在攻防安全能力上达到新的里程碑
  • 若自主发现零日漏洞的能力属实,将对软件安全审计与攻防格局产生实质影响,同时滥用风险与配套安全措施成为关注焦点