极端量化模型被指刷榜注水,真实输出近乎不可用
X 用户 teortaxesTex 等人炮轰以 Prism Bonsai 系列为代表的极端压缩模型,指出其基准成绩经过针对性优化,但实际能力远弱于原模型,常陷入过度思考死循环,输出基本不可用。他们还批评所有 2-bit 以下后训练量化方案,要么依赖基准数据显式修复压缩损伤,要么只在狭窄基准上衡量恢复效果,最终得到的是脆弱的「刷榜机」,引发社区对量化评测可信度的讨论。
2026-09-19 ~ 2026-09-19 · 2 条相关
- 实测打脸:Prism 极致量化模型被指跑分注水,真实能力几乎不可用 — teortaxesTex · 2026-09-19
- 极端压缩模型被斥为「脆皮刷榜机」,2-bit 以下量化遭全面看衰 — teortaxesTex · 2026-09-19