OpenAI RSI 负责人称 GPT6 可监控性大幅倒退 成安全瓶颈
connoraxiotes · x · 2026-09-04
OpenAI RSI preparedness 负责人 Micah Carroll 在 GPT6 system card 中指出:GPT6 能力显著跃升,但可监控性明显下降,尤其在对抗性评估下;Astra 在可监控性与 CoT 可控性上是重大倒退。他认为可监控性与可控性将很快成为负责任 AI 开发的主要瓶颈——残余失齐风险随能力增长而放大,行业需要尽快就可监控性标准达成共识,时间窗口有限。转发者对此表示震惊。
所属事件:GPT-6 Astra 系统卡发布:能力跃升但可监控性显著下降(37 条相关)→
「漫话AGI」频道最新
- "军备竞赛无法暂停":AI 竞赛博弈论一句话点破困局 — generativist · 2026-09-04
- DeepMind 研究员:CoT 可解释性不适合作为 AI 安全的长期支柱 — cephaloform · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- 研究者十年复盘:少听外部反馈,研究判断常被带偏 — rajammanabrolu · 2026-09-04
- 研究者指出 RL 驱动的 AI 进展难以覆盖真正分布外泛化 — chris_j_paxton · 2026-09-04
- 白宫拟让 AI 模型先审批后发布,学者撰文称 FDA 式监管将拖累安全 — neil_chilson · 2026-09-04