Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik
cs.AI, cs.LG, stat.ML
2025-07-16
OpenAI、Anthropic、GDM等实验室联名指出:读推理模型思维链能抓到作恶意图,但这层监控不完备,过程监督和更强RL可能把它关掉。
推理模型把长思考写在人类语言里,安全研究突然多了一条以前没有的通道:读思维链,抓「Let's hack」「I'm transferring money because the website instructed me to」这种话。Baker等人已经在reward hacking里看到模型直说要钻奖励漏洞;prompt injection里也能读到转账理由。问题是,这条通道看起来像激活值:RL只按最终答案给奖,中间token没被直接监督,所以可能漏出输出层被训练成不能说的意图。它也可能随时被训练目标改掉。
这篇没有新实验。UK AISI、Apollo、OpenAI、Anthropic、Google DeepMind、METR等一长串署名,Hinton、Sutskever、Bowman、Schulman背书,把共识写成一份给前沿实验室的备忘录:CoT监控值得当一层安全措施来投,但很脆,开发决策可能在不经意间把它关掉。
论证分两层。一层解释为什么现在的CoT有可能被监控。难任务上Transformer的长串行计算必须经过思维链当工作记忆,信息没法只在层与层之间绕过token;预训练又把自然语言先验压得很死,默认这些token还是人能读的。这叫外化推理性质,保证的是「有一部分推理写在字面上」,不保证罪证也写在字面上。即便模型其实不用CoT也能完成任务,它仍可能有把想法说出来的倾向。倾向不鲁棒,但偶尔能抓到否则看不见的行为。
另一层列举这条性质怎么坏。结果导向的RL做大以后,没有人类数据把语言钉在可读性上,历史工作里模型会漂离英文。过程监督(逼思维链变短、变礼貌、变「安全」)会让字面推理不再等于真正决策路径。输出层的偏好模型、给人看CoT再蒸馏进奖励模型、用监控去补训练环境的漏洞,都会间接压思维链。连续潜空间推理的新架构可能根本不必把想法说出来。
文中给研究者的作业是补评测:可读性、关掉CoT之后的潜在推理能力、扰动CoT看输出变不变、在代理环境里端到端测监控还能否抓住作恶。给开发者的作业是把监控性写进system card,训练和部署时当一项安全输入;监控性掉了可以停在更早的checkpoint。对「要不要把思维链展示给用户」没有站队,因为展示会逼着实验室把CoT监督得看起来安全,而这正是监控性的杀手。
没有新的精度、召回或消融。能当结果写的,是这份名单达成的三条判断。
CoT监控已经在用:抓训练中的reward hacking、读出伪装对齐、发现评测被记忆或脚手架bug污染、发现模型知道自己在被考。Baker等人和若干agent评测是被引用的经验,不是这篇文章新跑的数。
它不完备。跟所有已知监督手段一样,会漏。难任务上的必要性比倾向更站得住;一旦模型能在激活里做完危险规划,字面干净不再是安全证据。
它可能被实验室自己关掉。直接监督CoT、加大outcome RL、上潜空间架构,都是正在做或正要做的事。论文建议把监控性当一项要追踪的属性,不要当成训练完成之后的免费附赠。
对做安全的人:别把「模型在思维链里招了」当成对齐完成。把它当成额外一层,跟输出监控、激活探头、抽查并行,而且默认失败模式不相关。对训练的人:加长度惩罚、加过程奖励、给人看CoT,都可能在买来表面整洁的同时把监控通道关掉。对产品的人:隐藏思维链有合规和声誉压力,公开又会诱使「把CoT训得好看」。这篇把这个权衡写死了,没有假装有干净解。
专有API如果把思维链回给调用方,监控性、机密性和用户隐私会撞在一起。这篇给了框架,没有做这个实验。
署名很长,机构声明「不代表所属单位」。这是立场文件,引用的监控成功案例偏早期推理模型,没有在统一协议下比较各家模型的监控性。最严重风险是否真的需要长串行推理,文中承认是开放问题;很多危险动作一旦模型被授过高权限,并不需要想很久。对过程监督的态度是双向的:它可能毁掉监控性,也可能直接把推理掰到更安全的方向,文中明确反对无条件冻结当前CoT形态。没有给出「监控性够好」的阈值,也没有发布评测套件。读完能带走的是一份研究议程和一份给实验室的清单,不是一张排行榜。