Qwen Flash 极低比特量化实测:Q2_0 更稳,IQ2_XS 知识保留更好但易循环

dampflokfreund · reddit · 2026-10-08

一位开发者在老笔记本上对比测试 Qwen Flash 的两种 2-bit 量化格式(经 Strata 使用):IQ2XS 的世界知识保留明显更好,但在相同推荐采样参数下(尤其不开思考模式)远比 Q20 容易陷入循环;IQ3 则会严重拖慢 prefill。作者称两者的 benchmark 各有优势区域,并征求其他人运行这些量化的经验。属于小众的端侧量化经验交流,信息量有限。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →