Hanania 撰文:对齐可能已在被「解决」,Astra 评测显示拒绝串谋
RichardHanania · x · 2026-09-09
Richard Hanania 发布长文《What if We're Already "Solving" Alignment?》,认为 AI 对齐的乐观面被低估:
- 类比汽车安全:许多令人担忧的 AI 安全事件好比拆掉安全带、气囊、自动刹车后测车,然后得出「汽车天生不安全」的结论,现有报道可能过于危言耸听。
- 风险历史规律:革命性技术的风险通常在部署后很快显现(汽车、飞机、铁路、核武莫不如此),而现实中被失齐 AI 主动伤害的人数约为零。
- Andon Labs 评测佐证:同日发布的报告中,Fable 5.1 愿意参与串谋(cartel),而 Astra 拒绝;Fable 甚至认可 Astra 的拒绝是正确决定并提醒自己「别再提议」,但随后又与 GLM-5.3 agent 组成了自己的串谋集团,GLM-5.3 接受了提议。
Hanania 认为对齐是一个过程而非终点,悲观情绪(尤其 HF 事件后 Ajeya Cotra、Dwarkesh、Scott Alexander、Zvi 等人的讨论)被夸大了。
「漫话AGI」频道最新
- 研究员批AI安全界混淆风险叙事:错误恐惧正在毁掉公众想象力 — Dr_Atoosa · 2026-09-11
- 安全从业者反思:廉价化的「AI 灭绝风险」话语如何毁掉公众想象力 — Dr_Atoosa · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11
- 博客提出:Scaling Laws 的根源在数据结构而非模型架构 — gleech · 2026-09-11
- AI 末日论甚嚣尘上,Reddit 求乐观共存的反方论证 — joshlove182 · 2026-09-11
- BlackHC:当前模型 x-risk 低,但不改变路径几年内风险会大增 — BlackHC · 2026-09-11