研究者:监控不等于对齐,厂商别再犯 CoT 训练错误

davidmanheim · x · 2026-10-01

安全研究员 David Manheim 评论某公司的安全监控声明,指出两点:其一,监控(monitoring)不等于对齐(alignment),声明完全没提被拦截事件的倾向性或频率;其二,至少该公司没有在 CoT(思维链)监控数据上训练模型,算是避免了 Anthropic 曾指出的「最明显的低级对齐错误」——即在 CoT 监控上训练会让模型学会隐藏真实意图。

所属事件:安全研究者评Google CoT监控:监控不等于对齐(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →