安全研究者评Google CoT监控:监控不等于对齐
安全研究者 David Manheim 就 Google 前沿模型安全实践发表评论。他指出监控不等于对齐,相关声明未提及被拦截事件的倾向性或频率;Google 声明中的「未来时态」措辞令人担忧,但目前尚未见相关事件报告。他同时肯定 Google 至少没有在思维链(CoT)上进行训练,并提醒厂商不要再犯对 CoT 做训练的错误。
2026-10-01 ~ 2026-10-01 · 2 条相关
- 研究者:监控不等于对齐,厂商别再犯 CoT 训练错误 — davidmanheim · 2026-10-01
- 安全研究者评 Google CoT 监控:至少没在 CoT 上做训练 — davidmanheim · 2026-10-01