ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度
giveen · reddit · 2026-08-24
ConvRot Quant 量化方法现已集成到 llama-cpp-turboquant 项目中。实测显示,Q6CR 配置在 KLD/PPL 指标上接近 Q8 质量,Q5CR 也有小幅提升。此外,新增 --moe-cache auto 功能可优化超显存 MoE 模型的运行体验,相关 PR 已修复之前的崩溃问题。
「Infra」频道最新
- 传英伟达明年初提价15%,内存成AI算力新瓶颈 — heyshrutimishra · 2026-08-24
- 2.7-bit量化把Llama 3.2 Vision 11B压到3.7GB上手机 — Luka Ribar · 2026-08-24
- DSCO Router 推出多模型统一网关,支持自带账号自动路由 — arthurcolle · 2026-08-24
- 开源方案 RobotSoul:为 Agent 提供上下文重置后的持久身份 — robauto-dot-ai · 2026-08-24
- 将 MoE 模型卸载至 RAM 运行会遭遇极慢的 Prefill — former_farmer · 2026-08-24
- Etched获10亿美元融资,Jane Street领投验证专用芯片 — TheTuringPost · 2026-08-24