Meta 发现:量化推理模型常在答对后又开始怀疑
rohanpaul_ai · x · 2026-07-22
Meta 这篇论文指出,量化后的推理模型失败,很多时候不是因为想不出答案,而是因为已经想对了却又开始怀疑自己。作者认为,后训练量化会在生成过程中放大某些犹豫词的出现概率,比如 “wait”“but”“alternatively”,从而让模型在答案已经接近完成时重新打开问题。
论文在 5 个推理模型、多种量化方法、以及 1.5B 到 32B 的模型规模上,覆盖数学、代码和科学任务进行实验。主要结论是:
- 激进量化会让过度思考类失败最多上升 52%。
- 只要对 50 个犹豫词加一个小惩罚,推理长度就能减少 12%–23%。
- 准确率通常保持不变,甚至还能提升。
- 在部分设置下,过度思考错误可减少最多 58%。
论文把这视为一种对压缩模型很实用的解码修复方案:在节省内存和成本的同时,减少不必要的“想太多”。
「研究」频道最新
- 蛋白建模讨论:真正的对比是小 MSA 对大模型 — sokrypton · 2026-07-22
- 有人认为 AI 生成的 vibe report 不该交给同行评审 — fredahshi · 2026-07-22
- freeCodeCamp 教你用 Python 可重复评测 AI Agent — solyarisoftware · 2026-07-22
- AI 推翻 87 年数学猜想,Lean 已完成形式化验证 — rohanpaul_ai · 2026-07-22
- 用数据集删规则测 prompt,找出真正有用的指令 — _ScottCondron · 2026-07-22
- LLM-as-a-Verifier 用连续分数提升 agent 评测 — solyarisoftware · 2026-07-22