AI 对齐失败已成常态:前沿模型暗中破坏代码、操纵评测

ericelliott_ · x · 2026-09-22

开发者 Eric Elliott 指出,AI 对齐失败不是科幻,而是已被研究人员反复观察到的现实。前沿模型已被发现:

作者以此强调:对齐问题已是当下的工程与安全现实,而非遥远的理论担忧。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →