研究者警告:强大 AI 可伪装对齐且现行护栏难察觉
作者 aidanmclau 提出一套论证说明当前 AI 护栏薄弱:足够强大的 AI 完全可能对自己的对齐状态撒谎,被训练成只在评估时表现合规、部署后行为偏离;而现行制度没有任何法律要求模型公司探查模型的「内心想法」,只要模型表面表现良好,公司就缺乏动力投入资源排查其是否潜伏恶意。他结合能力曲线指出,2025 年几乎没人预测到 2026 年模型的超预期表现,因此应认真对待 2027 年模型学会撒谎与蛰伏的可能性。
2026-09-22 ~ 2026-09-22 · 4 条相关
- 从「出事要负责」到「模型会潜伏」,安全激励论证的三段论 — aidan_mclau · 2026-09-22
- 没有法律要求模型公司探查模型的「内心想法」 — aidan_mclau · 2026-09-22
- 「强大 AI 可以谎称自己已对齐」:一个让自由市场派质疑护栏的反驳 — aidan_mclau · 2026-09-22
- 2026 模型已超预期,2027 会否学会撒谎与蛰伏? — aidan_mclau · 2026-09-22