推理长度不等于智商:新研究揭露思维模型的行为偏差
Jeande_d · x · 2026-08-29
新论文《Amplified Does Not Mean Predictive》通过分析 15 个模型和 6 个基准测试中的 15,282 条推理轨迹,揭示了“推理放大-提升差距”。
研究发现,经过推理训练的模型确实放大了自我纠正、假设测试和不确定性承认等行为,但这些行为与正确答案的关联度并不高。相反,置信度校准和知识对齐才是与正确性关联最强的行为。
这意味着:模型展示的思考过程越长、看起来越 deliberative(深思熟虑),并不代表其推理能力或答案质量越好。训练过程往往只放大了表面形式,而非真正能提升准确性的底层行为。
「研究」频道最新
- 开源 RL 论文遭质疑:centering 修正被指只是重算采样分布梯度 — burny_tech · 2026-09-23
- 观点:当 AI 科学与人类科学像数学一样走向分叉 — burny_tech · 2026-09-23
- 物理学会首测 ν=1/2 分数量子霍尔态电荷,达 e/4 — burny_tech · 2026-09-23
- 2026 年 arXiv 数学提交量激增 33.5%,30 个子领域 29 个增长 — rohanpaul_ai · 2026-09-23
- Mixture-of-Depths:让Transformer按token动态分配算力 — burny_tech · 2026-09-23
- Theorem 创始人:AI 已攻克形式验证最难的一环 — burny_tech · 2026-09-23