Meta 发现:量化推理模型常在答对后又开始怀疑
rohanpaul_ai · x · 2026-07-22
Meta 这篇论文指出,量化后的推理模型失败,很多时候不是因为想不出答案,而是因为已经想对了却又开始怀疑自己。作者认为,后训练量化会在生成过程中放大某些犹豫词的出现概率,比如 “wait”“but”“alternatively”,从而让模型在答案已经接近完成时重新打开问题。
论文在 5 个推理模型、多种量化方法、以及 1.5B 到 32B 的模型规模上,覆盖数学、代码和科学任务进行实验。主要结论是:
- 激进量化会让过度思考类失败最多上升 52%。
- 只要对 50 个犹豫词加一个小惩罚,推理长度就能减少 12%–23%。
- 准确率通常保持不变,甚至还能提升。
- 在部分设置下,过度思考错误可减少最多 58%。
论文把这视为一种对压缩模型很实用的解码修复方案:在节省内存和成本的同时,减少不必要的“想太多”。
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27