Unsloth 版 Qwen3.8-27B 移植 MTP 模式,显存占用更低
Nyghtbynger · reddit · 2026-08-23
作者将 MTP 模式移植到 Unsloth 版本的 Qwen3.8-27B 模型中,解决了官方版本不自带 MTP 的问题。在 Vulkan 上测试显示,这种嫁接方式相比使用外部文件能节省 RAM。不过模型在 Thinking 关闭时表现较差,但在开启 Thinking 后,针对特定文化问题的回答质量有所恢复。
「Infra」频道最新
- Unswarm:自托管 LLM 运行时管理器,支持多模型队列与代理 — Atretador · 2026-08-23
- Mistral 被曝 2030 年前在欧洲布局至多 1GW 算力 — emmanuelvivier · 2026-08-23
- AI 与 RAG 必读:新闻搜索 API 深度横向对比 — ermanos12 · 2026-08-23
- 8 张 B300 跑 Kimi K3:每百万 token 成本 190 美元,附完整部署账单 — OtherRaisin3426 · 2026-08-23
- 因 DRAM 短缺,英伟达 AI 服务器价格 reportedly 上涨 15% — The Decoder · 2026-08-23
- ComfyUI 节点优化:稀疏注意力提速 5-20% — Zironic · 2026-08-23