Qwen3.8-27B 去审查量化版发布,FastMTP 推理提速最高 3.02 倍
hauhau901 · reddit · 2026-08-18
社区量化作者 HauhauCS 发布 Qwen3.8-27B Uncensored Aggressive,覆盖全套 KP 量化(Q8 到 IQ2)、视觉支持与原生 NextN,去审查配置下测试 465 个提示零拒绝,且保留原模型的推理、Agent 与图文视频能力。发布期间已有 400 多人申请访问,其模型在 Hugging Face 累计下载近 3000 万。
最大亮点是 HauhauCS FastMTP 加速方案:在 Q8KP 实测中,文档生成(TG)提速最高 3.02 倍、推理提速 1.93 倍;相比标准嵌入式 MTP 也高出 35.2% 和 21.1%,每个草稿 token 仍由目标模型验证。同一个 903 MB 的 FastMTP sidecar 通用于全部量化档位,需配合 llama.cpp 补丁,README 给出了完整构建与部署命令。
其他要点:
- KP 量化为模型定制 profile,体积仅增 5–15% 即可换取一到两档的质量提升
- 27B dense、64 层(48 层 Gated DeltaNet + 16 层门控注意力)、原生 262K 上下文
- 提供思考/非思考两套采样参数;作者同时警告有人在其名号的 GGUF 中植入恶意 payload,提醒核对校验和
「Infra」频道最新
- AI 发展遇阻:电网并网排队时间激增至 45 个月 — PeterDiamandis · 2026-08-18
- 多卡 3090 本地推理:2026 年散热方案求助 — Sevealin_ · 2026-08-18
- 英伟达锁定明年全球 35%-40% HBM 产能 — JOBhakdi · 2026-08-18
- pagedMark:苹果硅芯端移除 SynthID 水印 — d0ofz · 2026-08-18
- 前 SpaceX 工程师创办 1872,打造 AI 机器人钢厂 — Ars Technica AI · 2026-08-18
- Qwen3.8-27B 在 4x RTX 3090 上的深度基准测试 — Mr_Moonsilver · 2026-08-18