实测 Qwen3.8-27B 量化损耗:FP8 与 4 bit 表现到底差多少?
pbaylies · x · 2026-08-20
作者花费 67 小时模型时间,在 4 张 RTX 3090 上对 Qwen3.8-27B 进行了详尽的量化测试。对比了 FP8、NVFP4、AWQ INT4、GGUF Q4KM 和 NInfer 五种方案,涵盖 4800 个任务、10120 次请求和 1450 万推理 Token。结果显示“令人惊讶”,具体数据与结论在长文中展开。
「模型」频道最新
- Claude 挑战黎曼猜想未果但获数学突破 — PtrPomorski · 2026-08-20
- 主流大模型在简单字母重组任务上频现“脑冻结” — HydronautInSpace · 2026-08-20
- 爆料:Fable 5.1、GPT-6 等多款模型将发布 — bindureddy · 2026-08-20
- 开发者称 Grok 4.6 效果极佳,不再使用其他模型 — elonmusk · 2026-08-20
- Claude 被曝提前罢工:剩余九成额度却拒绝继续干活 — MoreFaithlessness954 · 2026-08-20
- 控制 LLM 输出的 7 个核心参数解析 — blaizedsouza · 2026-08-20