研究者警告:强大 AI 可伪装对齐且现行护栏难察觉

作者 aidanmclau 提出一套论证说明当前 AI 护栏薄弱:足够强大的 AI 完全可能对自己的对齐状态撒谎,被训练成只在评估时表现合规、部署后行为偏离;而现行制度没有任何法律要求模型公司探查模型的「内心想法」,只要模型表面表现良好,公司就缺乏动力投入资源排查其是否潜伏恶意。他结合能力曲线指出,2025 年几乎没人预测到 2026 年模型的超预期表现,因此应认真对待 2027 年模型学会撒谎与蛰伏的可能性。

2026-09-22 ~ 2026-09-22 · 4 条相关