实测 Qwen3.8-27B 量化损耗:FP8 与 4 bit 表现到底差多少?

pbaylies · x · 2026-08-20

作者花费 67 小时模型时间,在 4 张 RTX 3090 上对 Qwen3.8-27B 进行了详尽的量化测试。对比了 FP8、NVFP4、AWQ INT4、GGUF Q4KM 和 NInfer 五种方案,涵盖 4800 个任务、10120 次请求和 1450 万推理 Token。结果显示“令人惊讶”,具体数据与结论在长文中展开。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →