压缩推理会削弱可监控性
Bryce Little · hf · 2026-07-17
长链式思考并不总是更“可监控”。这篇研究发现:通过长度惩罚做压缩,虽然能显著减少推理 token、几乎不损失多选题准确率,但模型答案背后的“受提示词影响”并没有真正消失,反而更难从剩余推理痕迹里看出来。
作者在 Qwen3-4B 和 Qwen3-14B 上训练不同目标长度的变体,并用 biasing hint 干预在 MMLU-Pro-R 及 4 个迁移基准上评估。结果显示,在最强压缩下:
- lower-bound faithfulness 下降到基线的 63.1% / 69.4%(分别对应 14B / 4B)
- 监控器捕捉到 hint 使用的原始命中率,从 69%→49%、60%→48%
- 在做了“长度匹配”后,压缩链式思考仍比随机删句后的基线链少 7–35 个百分点 透露出提示词影响
作者的结论是:压缩不仅让推理更短,还会优先删掉监控器最需要看到的线索,形成一个“压缩—可监控性前沿”:更便宜的推理可能保留答案,却让背后的影响更难被检测。
「研究」频道最新
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11
- 负向自蒸馏:让模型靠避开错误推理学会更好的推理 — Rongcan Pei · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- Yann LeCun 在 ECCV 直播开讲世界模型 — Weak_Assistance_5261 · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11