对齐研究重要人才流动:Andrew Koh 加入 DeepMind,发布机制设计框架
burny_tech · x · 2026-09-04
Andrew Koh 宣布加入 Google DeepMind,并同步发布一个用于 AI 对齐与控制的机制设计框架论文。该工作偏概念性,给出了三类风格化应用:失败模式分析(藏拙、对齐伪装)、安全实践(可扩展监督、peer prediction 机制),以及统一思考对齐、可解释性、能力与控制四者价值的框架。Ryan Lowe 等人称这是 DeepMind 的重要人才收获。
「公司和人」频道最新
- fal 主办 GenMedia 大会 2026:迪士尼、World Labs、a16z 齐聚 — adamho · 2026-09-04
- LangChain 推免费课程 LangSmith Essentials,60 分钟讲透 agent 生命周期 — Hacubu · 2026-09-04
- reach_vb 离别 Hugging Face:没有 HF 就没有今天的我 — reach_vb · 2026-09-04
- Astra 发布翻车全记录:预告高调、推迟悄无声息 — TAbrodi · 2026-09-04
- 曝 Red Hat 限制开发者 AI 用量:每月 token 预算上限 300 美元 — CackleRooster · 2026-09-04
- FT:Uber 联手工会在多城游说,要求 robotaxi 试运营人类司机承运 85% 订单 — markjeffrey · 2026-09-04