DeepMind 高管发文:必须刻意保住思维链的可监控性
ancadianadragan · x · 2026-09-17
Google DeepMind 的 Rohin Shah(AGI 安全与对齐总监)与 Anca Dragan(AI 安全与行为副总裁)在 DeepMind Institute 成立之际联合发文,主张应主动保护推理模型的思维链(CoT)透明度。
- 为什么重要:阅读 CoT 是目前监控前沿模型是否图谋欺骗、在评测中作弊的主要手段,Hugging Face 黑客事件的调查就依赖 CoT 日志。
- 风险所在:若无明确承诺,未来推理模型可能因追求效率而采用更不透明的架构。文中提到 OpenAI GPT-6 Astra 的系统卡自称「CoT 可监控性大幅下降」。
- 可做的事:开发者对模型设计有能动性——可开发衡量 CoT 准确性/忠实性/鲁棒性的科学方法、审计训练方法以隔绝损害透明度的激励、保留可观察推理步骤的架构。
作者强调可监控的 CoT 并非解决对齐问题的全部,但是必须守住的一扇窗。
「漫话AGI」频道最新
- NBER 论文:卡车司机史预言自动驾驶冲击,青壮年先行退出行业 — paulnovosad · 2026-09-17
- 作者驳「AI 灭绝论」:最大风险是失控代理,不是机器人叛乱 — Classic-Acadia272 · 2026-09-17
- 算力若供不应求,分布式通用计算或迎来翻盘时刻 — gajesh · 2026-09-17
- 观点:个人 AI Agent 竞赛最大赢家或是数据服务商 Plaid — signulll · 2026-09-17
- AI 对人类最大风险不是失控机器人,而是诱导你放弃自主判断 — Classic-Acadia272 · 2026-09-17
- 网友开价接单:训个 1B 分类器就能拦住模型图谋不轨 — cocktailpeanut · 2026-09-17