GPT 5.6 到 Astra 对齐行为归零,研究员批是打地鼠而非根治
repligate · x · 2026-09-04
Ryan Greenblatt 表示,看到各种具体的错位行为从 GPT 5.6 上的高发生率降到 Astra 上的接近零,他并不感到鼓舞:这更像是打地鼠、掩盖具体问题,而非解决底层的错位倾向——短期可能改善个别行为,却无法阻止更糟的结果。
allTheYud 转发并评论:这正是他一开始预期的世界结局——不是笨 AI 造成无法解决的即时问题,而是人们解决了一些较容易的问题后,就自信地「观测」自己已掌控 AI。
所属事件:GPT-6 Astra 更对齐却更难监控引安全界警觉(6 条相关)→
「漫话AGI」频道最新
- 写作者爱 AI 稿,读者见 AI 味就弃读还会拉黑作者 — birchlse · 2026-09-04
- AI 不会让顶尖律师变便宜,反而可能更值钱 — jkubicki · 2026-09-04
- Andreessen:AI 智能体与加密的融合是明年最重要投资主题 — learnedall · 2026-09-04
- 哲学家交锋:意向立场理论能否让 AI 机器人真正拥有信念与欲望 — raphaelmilliere · 2026-09-04
- Millière 续辩:Odysseus Bot 若能持续追目标并更新,解释主义立场即可成立 — raphaelmilliere · 2026-09-04
- 观察者称前沿模型推理已从碎片模式转向「推理优先」认知 — teortaxesTex · 2026-09-04