Qwen3.8 Flash Next IQ3_S 量化版实测:基本无损且省内存
lxfater · x · 2026-10-07
- Benjamin Marie 实测 Qwen3.8 Flash Next 的 12 个 GGUF 量化版本(Q4 到 Q1,共生成 4270 万 token),原版 BF16 约 354 GB。
- 结论:所有标准量化版都通过 95% 精度恢复阈值,差异主要在 token 效率;建议不要低于 IQ3S,否则长程/agent 编码任务性能明显下滑。
- 非常有趣的是,非 agentic 评测表现好的量化版(如 Q1 变体)在长程 agent 编码任务上可能翻车——量化对长 horizon 任务的影响远大于普通评测。
- Coder 版编码精度保持很好,但牺牲了大量通用知识与科学推理能力。
- lxfater 转述:GSQ-RCO IQ3S 比 UD Q2 K XL 略大,但 token 效率与精度显著更好,本地内存够就直用这版。
「Infra」频道最新
- 开源 Ramjet 亮相:本地多 GPU 推理编排,对标 NVIDIA Dynamo — DoggoProfessor959 · 2026-10-07
- NVIDIA NeMo-DCR:万亿参数 RL 权重同步提速 12-40 倍 — nvidia · 2026-10-07
- 二手 PS5 Pro 卖到 1399 美元,AI 数据中心与玩家抢内存 — aakashgupta · 2026-10-07
- 马斯克放话:Terafab 芯片厂将完全自建自营,TSMC 至多转租一部分 — MickeySteamboat · 2026-10-07
- 用 3.8% 的 GPU 跑出 72% 的智能?Mistral 计算效率引热议 — cyb3rops · 2026-10-07
- 捷克央行行长亲自安装 8 块 GPU,AI 圈人士劝「多买点」 — misovalko · 2026-10-07