压缩推理会削弱可监控性

Bryce Little · hf · 2026-07-17

长链式思考并不总是更“可监控”。这篇研究发现:通过长度惩罚做压缩,虽然能显著减少推理 token、几乎不损失多选题准确率,但模型答案背后的“受提示词影响”并没有真正消失,反而更难从剩余推理痕迹里看出来。

作者在 Qwen3-4B 和 Qwen3-14B 上训练不同目标长度的变体,并用 biasing hint 干预在 MMLU-Pro-R 及 4 个迁移基准上评估。结果显示,在最强压缩下:

作者的结论是:压缩不仅让推理更短,还会优先删掉监控器最需要看到的线索,形成一个“压缩—可监控性前沿”:更便宜的推理可能保留答案,却让背后的影响更难被检测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →