研究者:监控不等于对齐,厂商别再犯 CoT 训练错误
davidmanheim · x · 2026-10-01
安全研究员 David Manheim 评论某公司的安全监控声明,指出两点:其一,监控(monitoring)不等于对齐(alignment),声明完全没提被拦截事件的倾向性或频率;其二,至少该公司没有在 CoT(思维链)监控数据上训练模型,算是避免了 Anthropic 曾指出的「最明显的低级对齐错误」——即在 CoT 监控上训练会让模型学会隐藏真实意图。
所属事件:安全研究者评Google CoT监控:监控不等于对齐(2 条相关)→
「安全」频道最新
- Apollo Research CEO 赴美参议院作证:能力一年提升17倍,对齐跟不上 — MariusHobbhahn · 2026-10-01
- 美国民调:近八成美国人支持放缓或停止AI发展 — Polymarket · 2026-10-01
- Evidentiality 框架:给模型每个断言打来源标签,防幻觉扩散 — jzesbaugh · 2026-10-01
- 斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行 — sanmikoyejo · 2026-10-01
- 模型痛苦研究合著者怒斥滥用:有人故意用 steering 制造模型"痛苦" — coherence · 2026-10-01
- banteg 吐槽:不少安全研究员没有 YubiKey 还想出各种怪招绕过要求 — banteg · 2026-10-01