DeepMind 前可解释性负责人深度对谈:如何防止 AI 变坏
adityaag · x · 2026-08-14
DeepMind 前可解释性联合负责人、Goodfire AI 联合创始人分享了关于 AI 安全与对齐的深度见解。访谈涵盖了 AI 可解释性的核心问题、奖励作弊现象,以及如何通过神经几何学等手段干预和引导模型的学习过程。此外,他还探讨了如何将可解释性研究转化为实际产品,以及在创业环境下做研究的差异。
所属事件:Goodfire联创探讨AI可解释性与防范奖励作弊(3 条相关)→
「漫话AGI」频道最新
- 红杉合伙人:AI推理成本下降正同步做大模型与应用厂商的蛋糕 — annbordetsky · 2026-08-14
- 斯坦福 HAI 呼吁:科学界需要真正的开源 AI 模型 — StanfordHAI · 2026-08-14
- 预测:半数 AI 创业公司将被大模型更新淘汰 — bennash · 2026-08-14
- AI 模型开发者应否拒绝与压迫性政府合作? — deanwball · 2026-08-14
- 视频生成与智能体爆发,看空 AI 等于错失数十万亿价值 — Dr_Singularity · 2026-08-14
- AI代理将颠覆流媒体广告模式,透明度问题或加剧 — Kyrannio · 2026-08-14