antirez 解析 Qwen 3.8 Flash Next:N-gram 表或成 64GB Mac 本地推理优选
Redis 作者 antirez 对 Qwen 3.8 Flash Next 的架构进行了连续解析,并得出一个本地推理层面的实用结论:由于 510 亿条 n-grams 可以驻留在 SSD 上,2 比特量化版本的 Qwen 3.8 Flash Next 可能是目前 64GB MacBook 上进行本地推理的最佳 DwarfStar 方案。
已确认
- 架构核心是 n-grams 机制:模型在第二层使用一个 51B(510 亿)规模的 n-grams 表来"丰富"当前 token 的表示,并通过门控控制传递量。
- 具体流程为:Layer 1 获取最后 2 个和 3 个 token(双元组与三元组),从 51B 数据库中检索 16 个小向量,组合成一个大向量,在 Layer 2 通过门控注入当前 token 的表示。由于双元组和三元组数量过多,索引用压缩哈希实现。
- 巧妙之处在于时间差利用:Layer 1 处理期间,可利用掩码加载(mask load)提前从 SSD 读取这 16 个小向量,掩盖访存延迟。
- 语义层面的意义:类似将字符组合成词(如 "New"+"York" → "New York"),让 "York" 的表示直接携带 "New York" 的高层概念,后续层无需在底层耗费算力组合字符,可直接处理更高层级概念。
- 资源收益:n-gram 表在语义增强上的作用可节省部分骨干权重。
为什么重要
- 51B n-grams 表体量远超内存可容纳范围,但 SSD 驻留设计使其不需要全部载入 RAM,这为 64GB 内存级别的消费级设备运行大参数量模型提供了新路径。
- 该机制展示了模型设计者如何利用"检索 + 门控"替代部分 Transformer 层的底层计算,antirez 的测算为本地推理用户提供了具体的硬件选型参考。
2026-08-30 ~ 2026-08-30 · 7 条相关
一手来源
- Qwen 3.8 Flash Next 量化版或成 64GB Mac 本地推理优选 — antirez ·
- Qwen 3.8 Flash Next 架构解析:利用 Next-n-grams 优化推理 — antirez ·
- Qwen 3.8 Flash Next 用 N-gram 表节省骨干权重 — antirez ·
- 【源头】Qwen 3.8 Flash Next 量化版或成 64GB Mac 本地推理优选 — antirez · 2026-08-30
- 【源头】Qwen 3.8 Flash Next 架构解析:利用 Next-n-grams 优化推理 — antirez · 2026-08-30
- Qwen N-gram 机制利用 51B 表增强 Token — antirez · 2026-08-30
- 【源头】Qwen 3.8 Flash Next 用 N-gram 表节省骨干权重 — antirez · 2026-08-30
- Qwen 在 Layer 2 用 N-gram 丰富 Token 语义 — antirez · 2026-08-30
- Learned embeddings 让模型更直接处理高层概念 — antirez · 2026-08-30
- N-grams 压缩索引可像字符组合词一样提升效率 — antirez · 2026-08-30