剑桥研究者:AI 可解释与对齐方法有效但不可靠且无法修复

DavidSKrueger · x · 2026-09-22

David Krueger(剑桥 AI 安全研究者)回应质疑称,自己在可解释性、测试、对齐、控制四个领域都在顶级 AI 会议发表过工作。他表示这四个方向并非完全无效——我们已有相应方法——问题是它们不能可靠地工作,而且目前不知道如何修复这一根本缺陷。核心论点:我们不理解 AI 系统如何运作、无法预测其行为、无法阻止其不良行为、也无法确保在其失控时保持控制,这些基础研究问题多年悬而未决。

所属事件:剑桥学者:四大根本问题未解,AI 安全难靠限期攻关(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →