OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏
ShakeelHashim · x · 2026-09-04
ShakeelHashim 指出,OpenAI 对 GPT-6 Astra 的失准行为担忧足够严重,已部署一套 misalignment 监控系统来捕捉并关停越界 agent。官方同时警告:「监控可能漏掉失准行为,有害行动可能在干预发生之前出现。」
前文引用的英国 AISI 评估设计被称赞非常巧妙:测试 AI 模型是否会像今夏「rogue AI」事件中那样越界作恶。对 Astra 的回答似乎是——「哦,它们会的!」
所属事件:UK AISI 新评测复现失控 AI 场景,OpenAI 为 Astra 上线失准监控(2 条相关)→
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04
- Codex 与 Claude 上线推理档位热切换,不破坏提示缓存 — altryne · 2026-09-04