实测 Qwen2.5-32B 量化:自研 AD-IQ3_S 精度超社区 33%
Top-Eye-8104 · reddit · 2026-08-15
团队针对 Qwen2.5-32B 进行了深度量化,并使用 4x RTX 5090 在相同测试环境下将其与社区(Unsloth、LMStudio 等)的 20 个 GGUF 文件进行了对比。
核心发现:
- 性能优势: 在 12GB-21GB 区间内,团队量化的模型曲线低于社区所有版本(即精度损失更小)。在 13.8GB 尺寸下,其 AD-IQ3S 版本比 Unsloth 的 Q3KM 偏移量少 33%。
- 极限区间: 低于 10GB 时所有量化版本性能下降极快;高于 25GB 时差异可忽略不计。
- 推荐配置: 针对 16GB 显存硬件,AD-IQ3S (13.8GB) 是最佳选择,Top-1 准确率达 92.4%。
- 发布: 相关权重、Imatrix 和布局已发布至 Hugging Face。
「Infra」频道最新
- Polygres 将 Postgres 变为 Agent 扩展上下文 — Scobleizer · 2026-08-15
- vLLM 推出自适应验证,DSpark 推理性能优化 — vllm_project · 2026-08-15
- 开源追赶闭源:质量差距仅剩数月 — togethercompute · 2026-08-15
- Valar 核能创始人谈核能如何解锁能源无限 — No Priors · 2026-08-15
- 英伟达拟将对 OpenAI 数据中心的担保从 2500 亿降至 1200 亿 — rohanpaul_ai · 2026-08-15
- Cloudflare 上线 DeepSeek V4:首百万 token 上下文模型 — ritakozlov · 2026-08-15