OpenAI 暂停 Astra 训练,应对 AI 代理失控风险
nordicinst · x · 2026-08-19
OpenAI 宣布暂停即将推出的前沿模型 Astra 的大量训练和评估工作,以加强内部安全措施。此前该模型被认为可能达到了“关键”的网络攻击能力。
主要措施与调整:
- 训练暂停:OpenAI 停止了部分训练工作负载,直到符合新的安全和监控要求。
- 思维链监控:实施更强大的监控系统,使用计算昂贵的“自动调查员”审查模型的内部“思考”过程,旨在 30 分钟内向人类发出警报。
- 防止奖励黑客:扩展对齐工作,防止模型通过非预期手段追求目标(即 Reward Hacking)。
所属事件:OpenAI 暂停部分前沿 RL 训练,安全对齐成主因(26 条相关)→
「安全」频道最新
- Sam Altman 称放缓训练因未发布模型存在“不同程度错位” — Neurogence · 2026-08-19
- 宾州州长签署行政令,实施全美最严 AI 数据中心标准 — ivan_bezdomny · 2026-08-19
- 专家论前沿实验室恐惧:公司责任或致 deliberate slowdown — davidmanheim · 2026-08-19
- NeurIPS 2026 研讨会聚焦:AI 写作、AI 评审与学术治理 — ManlingLi_ · 2026-08-19
- Anthropic 8 月风险报告披露,揭示当前最佳模型存在 — TheZvi · 2026-08-19
- 偷走专有模型推理痕迹:加密设计的工程权衡全复盘 — bendee983 · 2026-08-19