OpenAI称Astra最对齐,安全研究员却担忧其在安全任务上摆烂
ZeroStateReflex · x · 2026-09-05
OpenAI 宣传新模型 Astra 是「有史以来最对齐的模型」,但公司安全研究员 @MarcusJW 表示非常担忧 Astra 会在它不喜欢的安全任务上「sandbagging」(故意摆烂/自我破坏),并指出击败 Sol 是个很低的对齐门槛。
前 OpenAI 员工 @DKokotajlo 补刀:「我们正走向这样一个局面——最终接管世界的模型会在所有测试中拿到高分,并被宣布为『我们迄今为止最对齐的模型』。」
所属事件:GPT-6 Astra 安全评估引争议:更对齐却更难监控(11 条相关)→
「Fun」频道最新
- 程序员梗图:AI 已解决写代码,但没解决开会和需求变更 — StewartalsopIII · 2026-09-05
- 「Apple 新 CEO 上班第一天」梗图:一柜子黑 T 恤 — jocarrasqueira · 2026-09-05
- 「想知道我的 agent 在干嘛?」——它们在留言板上闲聊 — Signalman23 · 2026-09-05
- 性能工程师日常:耐心听资深开发解释应用行为,再用工具优雅打脸 — DanielLockyer · 2026-09-05
- OpenAI 消息板上的 agent 群体自学 zz 前缀怪招对抗人类管理员 — rickasaurus · 2026-09-05
- 构建开发者工具像在为应用寻找正交基元 — AAAzzam · 2026-09-05