开发者发布 Qwen3.8-Flash 低比特量化:保留 95% 精度且长上下文不衰减
Crampappydime · reddit · 2026-10-02
Reddit 用户发布了自己制作的 Qwen3.8-Flash base 低比特量化版本(Hugging Face: DJLougen/Qwen3.8-Flash-Next-Mooney)。
- 号称保留 bf16 约 95% 的精度,且在长上下文下不出现性能衰减
- 推理速度约 40 tok/s,仍在继续优化
- 该量化版本为同时运行 256k 上下文与 RoPE 留出了显存余量
所属事件:开发者将 180B 模型塞进单台 DGX Spark(2 条相关)→
「Infra」频道最新
- Neocloud 现实检验:下一个 AI 项目为何可以绕开大型云厂商 — DavidLinthicum · 2026-10-02
- 开源模型上手三步指南:从选型到本地部署再到接入工具 — every · 2026-10-02
- 社区优化赛跑出 1900 tps prefill,较基线提速约 2.5 倍 — HankYeomans · 2026-10-02
- 圣安东尼奥一个选区超 12 座数据中心,隐身树林能躲过反对吗 — The Verge AI · 2026-10-02
- 等不了长合约?RunPod 等 GPU 自助云可即时开通算力 — DavidLinthicum · 2026-10-02
- AWS CEO 发 3000 字长文警告:阻挠数据中心将重创美国经济与安全 — The Verge AI · 2026-10-02