推理长度不等于智商:新研究揭露思维模型的行为偏差

Jeande_d · x · 2026-08-29

新论文《Amplified Does Not Mean Predictive》通过分析 15 个模型和 6 个基准测试中的 15,282 条推理轨迹,揭示了“推理放大-提升差距”。

研究发现,经过推理训练的模型确实放大了自我纠正、假设测试和不确定性承认等行为,但这些行为与正确答案的关联度并不高。相反,置信度校准和知识对齐才是与正确性关联最强的行为。

这意味着:模型展示的思考过程越长、看起来越 deliberative(深思熟虑),并不代表其推理能力或答案质量越好。训练过程往往只放大了表面形式,而非真正能提升准确性的底层行为。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →