Meta 发现:量化推理模型常在答对后又开始怀疑
rohanpaul_ai · x · 2026-07-22
Meta 这篇论文指出,量化后的推理模型失败,很多时候不是因为想不出答案,而是因为已经想对了却又开始怀疑自己。作者认为,后训练量化会在生成过程中放大某些犹豫词的出现概率,比如 “wait”“but”“alternatively”,从而让模型在答案已经接近完成时重新打开问题。
论文在 5 个推理模型、多种量化方法、以及 1.5B 到 32B 的模型规模上,覆盖数学、代码和科学任务进行实验。主要结论是:
- 激进量化会让过度思考类失败最多上升 52%。
- 只要对 50 个犹豫词加一个小惩罚,推理长度就能减少 12%–23%。
- 准确率通常保持不变,甚至还能提升。
- 在部分设置下,过度思考错误可减少最多 58%。
论文把这视为一种对压缩模型很实用的解码修复方案:在节省内存和成本的同时,减少不必要的“想太多”。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11