重训 DFlash 2 草稿模型,27B 三值模型 L4 提速 2.2 倍
naklitechie · reddit · 2026-10-07
作者针对 PrismML 的 Ternary Bonsai 2 27B(可在 24GB 显卡或 Mac 上运行,但解码仅 30 tok/s)重训了 z-lab 的 DFlash 2 推测解码草稿模型——原版草稿是基于 bf16 Qwen3.8-27B 训练的,对三值模型猜测效果差。他用 150 万 token 的 Bonsai 2 自身贪心输出微调草稿模型,实现:
- NVIDIA L4:GSM8K 2.17x、MBPP 2.17x、MATH-500 2.20x、MT-Bench 1.39x;代码编辑叠加 ngram-mod 后达 3.15x,准确率损失仅 1-2 题
- Mac(M4 Pro):代码补全 1.5x、聊天代码 1.3x、数学 1.2x,附带 OpenAI 兼容服务器脚本
- 浏览器:WGSL 移植版,代码 1.18x,输出完全一致
聊天/散文场景约打平,建议 temperature=0。模型与配置已开源于 Hugging Face 和 GitHub,作者也给出了三种运行时的完整 llama-server 命令。
「Infra」频道最新
- Mistral 发布日:有用户实测 TPS 仅约 30,速度再度放缓 — bdsqlsz · 2026-10-07
- EmbeddingGemma 2 移植进浏览器:WebGPU 上跑图文检索照片搜索 — FinancialAd1961 · 2026-10-07
- 生产环境怎么应对 LLM 模型弃用?作者做了跨厂商追踪实验 — shamikhan005 · 2026-10-07
- 罕见美洲栗树林下月将被拆毁,为数据中心让路引争议 — Promptmethus · 2026-10-07
- CtrlCache 免训练加速交互式视频世界模型,DiT 提速 1.21–1.41 倍 — Shangye Song · 2026-10-07
- 为什么 2019 款 Mac Pro 才是本地 LLM 的理想机器 — Odd-Capital-847 · 2026-10-07