FreeToken 分支支持 DeepSeek-V4.1 与投机解码,2x3090 实测数据公开
ApeGrower · reddit · 2026-09-22
作者分享了自己长期维护的 FreeToken 分支(Apache-2.0,匿名发布)。FreeToken 是边缘原生 MoE 推理引擎,把专家权重 offload 到主机内存/NVMe 并在 CPU+GPU 上协同执行,让消费级硬件能跑大 MoE 模型。
在 upstream 基础上的主要改动:
- 支持 DeepSeek-V4.1-Flash(mHC、CSA2 稀疏注意力、lightning indexer、Engram n-gram 记忆、DSpark draft)
- 为 Qwen3.8-Flash-Next 加入视觉能力,端到端支持 OpenAI imageurl 输入
- 投机解码:MTP draft head、拒绝采样、提交已接受前缀而非重新扩展、可选轮次链式
- FTW 快权重格式携带 side table(PLE/Engram)与 MTP head,支持 TP 切分
- 多模型张量并行加载、可选 fp8 all-reduce、重构量化配置层
硬件为 2x RTX 3090(张量并行=2)+ AMD EPYC 7203P。256 token 输出基准:greedy 无 MTP 为 48.0 tok/s;开 MTP 后 21.5(接受率约 56%),在当前配置下配合 CUDA graphs 反而是净损失——但在 eager 无重叠的对等条件下 MTP 达到约 1.5 倍(17.2 vs 11.4),作者正在优化 per-batch-size verify graph,暂不宣称已胜出。另提醒 DeepSeek-V4.1 的 Engram 表默认落盘,需预留磁盘空间。
「Infra」频道最新
- 用大鼠脑细胞造 AI,TBC 模型上线 AWS 有限预览 — nordicinst · 2026-09-22
- Cerebras 战略官:安全测试正成为算力厂商的新增长点 — RihardJarc · 2026-09-22
- 拆散实时语音栈成本降 14 倍,意外收获是文本层护栏 — Cloudsurfer_90 · 2026-09-22
- 黄仁勋:吉瓦级 AI 工厂投资高达 50-60 亿美元架构必须可通用 — nvidia · 2026-09-22
- Bloomberg 视 Nvidia 低市盈率为危险信号,博主反称低估值更诱人 — firstadopter · 2026-09-22
- 清华面壁等 CNCC 端侧大模型论坛:智能体、全模态与芯片级定制 — 面壁智能 · 2026-09-22