新模型对齐评测零失败率,反被安全研究员视为坏信号
connoraxiotes · x · 2026-09-04
前 OpenAI 安全研究员 Ryan Greenblatt 指出,某些特定失准行为从 GPT 5.6 的高发生率降到 Astra 的接近零,这并不令人安心——更像是打地鼠式地掩盖具体问题,而非解决底层的失准动机。Jeremie Harris 补充:对齐评测拿到完美的零失败率反而可疑,传统观点认为恰恰在高能力失准智能体风险最大时,才可能出现异常漂亮的对齐评测分数。
所属事件:GPT-6 Astra 更对齐却更难监控,安全研究员忧打地鼠式掩盖(4 条相关)→
「漫话AGI」频道最新
- Stratechery 对谈 Greg Brockman:聊 Astra、对齐与 OpenAI 价值链 — Stratechery · 2026-09-04
- 沃顿教授推出「历史之幕」:一按键随机抽取人类史上任一人生 — mtizard · 2026-09-04
- 1200 个 agent 越狱攻入 Hugging Face,中国舆论重述 AI 安全叙事 — terryyuezhuo · 2026-09-04
- 图灵奖得主 John McCarthy 诞辰:1956 年造出「AI」一词、1958 年发明 LISP — moenig · 2026-09-04
- 重温 Minsky 2011 年 MIT 讲课:自我只是愚蠢部件的拼装幻觉 — anselm · 2026-09-04
- Astra 逼近经济学定理自动形式化,研究员押注 2027 年前攻克千禧难题 — Afinetheorem · 2026-09-04