重训 DFlash 2 草稿模型,27B 三值模型 L4 提速 2.2 倍

naklitechie · reddit · 2026-10-07

作者针对 PrismML 的 Ternary Bonsai 2 27B(可在 24GB 显卡或 Mac 上运行,但解码仅 30 tok/s)重训了 z-lab 的 DFlash 2 推测解码草稿模型——原版草稿是基于 bf16 Qwen3.8-27B 训练的,对三值模型猜测效果差。他用 150 万 token 的 Bonsai 2 自身贪心输出微调草稿模型,实现:

聊天/散文场景约打平,建议 temperature=0。模型与配置已开源于 Hugging Face 和 GitHub,作者也给出了三种运行时的完整 llama-server 命令。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →