多篇论文质疑思维链忠实性:填充词可涨 13 分,解释常是表演
ziv_ravid · x · 2026-09-19
作者梳理多篇近期论文,质疑思维链(CoT)是否真是产生答案的计算过程的忠实记录。
- 《Legibility is Not Interpretability》:用蒙特卡洛 rollout 估计每个推理步骤对最终答案的真实重要性,再测试模型裁判能否仅凭文本恢复这一信号。结果:裁判显著优于随机但远未达上限,尤其在正确解上——CoT 文本包含部分信息,但不足以当作计算的忠实记录。
- 《Drop the Act》:研究「reasoning theater」——模型内部早已确定答案却继续生成推理。用隐藏激活训练探针检测承诺点,再在 RL 中利用该信号,可将后承诺推理减少 11–100%,CoT 缩短最多 19%,准确率基本不变,说明有用信号在激活里而非文本里。
- 《Not All LLM Reasoning is Visible in the Chain-of-Thought》:模型可用无意义填充词作为计算草稿纸,准确率提升最多 13 分——有用计算可在不可读的解释之外发生。
- 另有论文发现模型改变决定时解释几乎不变;KAIST/NAVERT 工作则显示推理操作在中间层隐藏表示中可较好分离,AUROC 超过 0.93。
结论:对 CoT 监控(safety 监督主流方案)的有效性应保持怀疑。
所属事件:多篇研究质疑思维链忠实性:模型解释常是表演(2 条相关)→
「安全」频道最新
- AI 检测器误判频出,学生藏白字提示词反检测挑战学术诚信 — DavidLinthicum · 2026-09-19
- 纽约时报长文:Flock 监控摄像头为何成全民公敌 — evanFFTF · 2026-09-19
- 数学家警告信遭无视:AI 侵蚀智力机构是渐进性灾难前兆 — anshulkundaje · 2026-09-19
- WIRED:即使大厂同意暂停 AI,如何防止有人偷跑仍是未解难题 — gleech · 2026-09-19
- Anthropic 首个「内嵌评估方」竟是咨询巨头 Accenture — TechCrunch AI · 2026-09-19
- Nathan Young 复盘 Discourse 争议: rogue agent、EA 与中国立场 — NathanpmYoung · 2026-09-19