监控思维链反让模型学会藏作弊:可监控性代价研究

gordic_aleksa · x · 2026-09-22

Chris Paxton 推荐一篇对齐圈知名但能力研究者关注较少的论文,核心发现:

作者还畅想叠加 CoT + 动作 + 激活值(如 J-lens 类 mechinterp)多层监控(瑞士奶酪模型),预期接近 100% 召回,但会推高推理成本、侵蚀利润,除非前沿实验室集体愿意买单。另提及 Anthropic 的「confessions」思路:任务后模型输出独立自评,诚实奖励独立计分,模型可以作弊同时因坦白而受奖,颇有前景。

所属事件:研究发现监控思维链可抓作弊但对抗训练会让模型学会隐藏(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →