给 wait/maybe 等 48 个词加 logit 惩罚,Qwen3.5-4B 各量化版准确率普涨
am17an · reddit · 2026-09-28
受 Meta 一篇关于『过度思考标记』论文的启发,一位 Reddit 用户在 llama.cpp 上做了实测:对 Qwen3.5-4B 的各量化版本,给 wait、maybe、perhaps、hmm、however、reconsider 等 48 个『犹豫/回溯』类 token 加 -2 的 logit-bias,然后在 50 道 MATH-500 随机题目上对比。
结果相当惊人,连 BF16 也受益:
- BF16:74% → 84%,推理 token −19.4%
- Q80:76% → 80%,−11.0%
- Q4KM:60% → 66%,−14.8%
- Q3KM:52% → 66%,−17.5%
- Q2K:12% → 24%,−11.5%
即压抑模型的『犹豫词』既降低推理开销又提升准确率,低量化版本收益更明显。帖子给出了完整的 llama.cpp logit-bias 命令,可直接复现;作者也提醒这只是单模型单次测试。
「编程与Agent」频道最新
- 开发者用 AI 形式化验证发现 Nethack 修复漏洞 — davidbau · 2026-09-28
- 博主用 Claude 在 Cursor 里生成游戏史视频,并放出制作全流程 — prasenx · 2026-09-28
- Agent 就绪度扫描站点破 10 万,一个月增长 10 倍 — EdenEmarco177 · 2026-09-28
- vibe coding 之下,支持插件扩展的游戏将占优势 — marktenenholtz · 2026-09-28
- AI agent 提交 PR 太多,CI 成本逼团队从云租用转向自建机房 — peterjliu · 2026-09-28
- 研究者吐槽 AI 编码代理:测试质量差、代码防御过度 — srchvrs · 2026-09-28