剑桥研究者:AI 可解释与对齐方法有效但不可靠且无法修复
DavidSKrueger · x · 2026-09-22
David Krueger(剑桥 AI 安全研究者)回应质疑称,自己在可解释性、测试、对齐、控制四个领域都在顶级 AI 会议发表过工作。他表示这四个方向并非完全无效——我们已有相应方法——问题是它们不能可靠地工作,而且目前不知道如何修复这一根本缺陷。核心论点:我们不理解 AI 系统如何运作、无法预测其行为、无法阻止其不良行为、也无法确保在其失控时保持控制,这些基础研究问题多年悬而未决。
所属事件:剑桥学者:四大根本问题未解,AI 安全难靠限期攻关(2 条相关)→
「漫话AGI」频道最新
- 研究者质疑:AI 辅助审稿初筛可能比人工更费事 — IanArawjo · 2026-09-22
- Khosla 预言个人 AI 两大护城河:数据信任与真正办成事 — brucemacv · 2026-09-22
- Halvar Flake 演讲:计算机科学正从精确学科变成概率学科 — soumitrashukla9 · 2026-09-22
- Epoch AI 研究员:2026 年 AI 能力首次对世界产生实质影响 — Jsevillamol · 2026-09-22
- 学界大佬警告:灌水论文留公开记录,恐毁研究生涯 — cocoweixu · 2026-09-22
- Josh Rosen 提出构建 System 1.5:用确定性架构连接快慢模型 — iamrobotbear · 2026-09-22