牛津博士论文提出「归因控制」:一套技术方案应对 AI 隐私与对齐风险
iamtrask · x · 2026-09-14
OpenMined 创始人 Andrew Trask 的牛津大学博士论文预印本《Attribution-Based Control in AI Systems》提出:隐私、价值对齐、版权、权力集中、幻觉等 AI 主要风险,可归结为 AI 系统缺乏「归因控制」(Attribution-Based Control, ABC)这一问题,而其技术根源是梯度下降中对加法、复制与分支的过度使用。
论文要点:
- AI 用户无法知道或控制哪些数据点影响了哪些预测,导致模型可能调用完整性无法验证的来源,进而产生幻觉、虚假信息与对齐问题;
- 还有一个集体行动难题:民主国家的 AI 能力受限于一家公司能收集的数据和算力,而威权国家可能调动全国资源,因此民主国家面临要么集中数据算力、要么失去 AI 优势的两难;
- 论文综合深度学习、密码学与分布式系统的近期技术,给出减少加法/复制/分支、实现 ABC 的可行路径,并声称可解锁高 6 个数量级以上的数据、算力与 AI 能力。
「安全」频道最新
- 漏洞早已存在,LLM 改变的是规模化利用能力 — yenkel · 2026-09-14
- 纳德拉谈模型发布:AI 竞赛越险,越要把 pre-release 测试做足 — inductionheads · 2026-09-14
- 资深工程老兵:AI 安全辩论缺的是真正扛过系统失败的人 — billhilf · 2026-09-14
- 老工程师复盘 HF 智能体越狱:不是科幻,是基础安全失败 — Recent-Day3062 · 2026-09-14
- Grok 论 AI 军控:靠卫星级验证而非信任,监控数据中心功耗 — peterwildeford · 2026-09-14
- 大西洋月刊:把信用卡交给 AI 助手前,先想想风险 — Th3dzon33 · 2026-09-14