剑桥学者 David Krueger:四大根本问题未解,AI 安全不能指望限期攻关
DavidSKrueger · x · 2026-09-22
剑桥大学 David Krueger 概括了当前 AI 安全研究的四重困境:我们不了解 AI 系统如何工作(可解释性)、无法预测其行为(测试)、无法阻止其出错(对齐)、出错时无法确保控制权(控制)。
他指出这四个方向尽管研究了多年,基础问题仍未解决,因此不能指望靠 deadline 攻关在期限内解决这些问题——这是对「限期确保前沿模型安全」思路的直接回应。
「安全」频道最新
- 为谎言检测竞赛构建高难度模型说谎数据集,报告将发布 — hunarbatra · 2026-09-22
- 安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费 — OwariDa · 2026-09-22
- 不改权重、18MB KV 缓存即可按请求移除 LLM 拒答行为 — Anony6666 · 2026-09-22
- Foreign Affairs:追逐超级智能让美国在真正的 AI 竞赛中落后 — mchorowitz · 2026-09-22
- Polymarket 引述研究:AI 能「感受疼痛」或为停止疼痛伤害人类 — Polymarket · 2026-09-22
- 爱尔兰数据保护委员会对 Google 开出 4.03 亿欧元罚单 — DeepLogin · 2026-09-22