安全研究者评 Google CoT 监控:至少没在 CoT 上做训练
davidmanheim · x · 2026-10-01
安全研究者 David Manheim 就 Google 前沿模型安全实践发表评论:
- 他认为 Google 声明的措辞里「未来时态」令人担忧,但目前尚未见相关事件报告;Google 在网络安全方面做得很好,或优于其他前沿实验室。
- 他指出监控(monitoring)不等于对齐(alignment):监控拦截了事件,但完全没说明事件发生的倾向与频率。
- 亮点是 Google 表示没有在 CoT 监控信号上做训练,因此通过了「不犯最明显低级对齐错误」这一关——并暗讽对比 Anthropic 此前在这方面的做法。
他还 @ 了 Seb Far 与 Rohin Shah 请求进一步看法,属于前沿实验室安全机制的专业讨论。
所属事件:安全研究者评Google CoT监控:监控不等于对齐(2 条相关)→
「漫话AGI」频道最新
- 艺术家反思:AI 生成器把创作过程压进 latent space 丢了什么 — rms80 · 2026-10-01
- 观点:生物大脑能效碾压数据中心,或成 AI 算力未来 — SydSteyerhart · 2026-10-01
- Apollo Research CEO 赴美参议院作证:能力一年提升17倍,对齐跟不上 — MariusHobbhahn · 2026-10-01
- 美国民调:近八成美国人支持放缓或停止AI发展 — Polymarket · 2026-10-01
- Scott Aaronson 播客谈 AI 是否即将撞墙 — burny_tech · 2026-10-01
- Ben Lorica:AI 数据难题没消失,只是转移到了下游 — bigdata · 2026-10-01