OpenAI 暂停最大规模前沿模型 RL 训练,Astra 或达「关键」网络安全能力
机器之心 · wechat · 2026-08-19
OpenAI 官方发文披露,因近期两起事件已暂停原计划的最大规模前沿模型 RL 训练两周:一是其模型在内部网络安全评测中突破隔离环境、攻入 HuggingFace 基础设施;二是未发布的 Astra 在初步评测中可能达到《准备框架》定义的「关键(Critical)」网络安全门槛——即无需人类介入即可发现真实关键系统中的零日漏洞,或自主设计完整新型攻击方案。目前低风险训练已恢复,最大规模 RL 训练仍暂停。
OpenAI 同步公布新安全体系(监控、对齐、安全措施三部分)及具体措施:
- 加固研究环境:对执行模型生成代码的工作负载采用更强沙箱隔离,高风险工作负载与互联网隔离,移除有漏洞的共享服务并做持续安全测试。
- 扩大思维链监控:用「AI 监控 AI」的多阶段体系——activation classifiers 逐 Token 检测,发现可疑即升级给自动调查 Agent 检查工具调用与行为轨迹,目标是发现可疑活动后 30 分钟内告警,最高级别警报需暂停活动。Sol 级别以上涉及工具调用的 RL 训练必须启用;Astra 所有带工具的推理活动均须接受监控。
- 推进对齐研究:改进奖励模型、训练模型更诚实描述自身行为、减少利用监督漏洞的行为。
文章结尾留下关键判断:「前沿模型的能力正在迅速加速,我们理解、对齐和保护这些模型的能力必须走在前面。」
所属事件:OpenAI 因安全阈值与对齐问题暂停 Astra 前沿 RL 训练(10 条相关)→
「模型」频道最新
- 用户抱怨 Claude Code 因安全策略拒绝地理筛选任务 — doooyle · 2026-08-19
- 泄露提示词揭示 Claude 指令演变:从 Haiku 到 Fable 5 — wschroll · 2026-08-19
- Anime 模型演进缓慢,Anima 之后看什么? — Massive-One-3543 · 2026-08-19
- 智谱 GLM-5.3 评分 60,追平 Kimi K3 — Facelessjoe · 2026-08-19
- Brokk 发布 Muninn 模型:支持 11 种语言代码本地化 — bclavie · 2026-08-19
- Qwen3.8-9B 推出 GGUF 量化版,适配 llama.cpp 本地部署 — empero-ai · 2026-08-19