安全研究者评Google CoT监控:监控不等于对齐

安全研究者 David Manheim 就 Google 前沿模型安全实践发表评论。他指出监控不等于对齐,相关声明未提及被拦截事件的倾向性或频率;Google 声明中的「未来时态」措辞令人担忧,但目前尚未见相关事件报告。他同时肯定 Google 至少没有在思维链(CoT)上进行训练,并提醒厂商不要再犯对 CoT 做训练的错误。

2026-10-01 ~ 2026-10-01 · 2 条相关