对齐研究重要人才流动:Andrew Koh 加入 DeepMind,发布机制设计框架

burny_tech · x · 2026-09-04

Andrew Koh 宣布加入 Google DeepMind,并同步发布一个用于 AI 对齐与控制的机制设计框架论文。该工作偏概念性,给出了三类风格化应用:失败模式分析(藏拙、对齐伪装)、安全实践(可扩展监督、peer prediction 机制),以及统一思考对齐、可解释性、能力与控制四者价值的框架。Ryan Lowe 等人称这是 DeepMind 的重要人才收获。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →