CPU 解码速度或只取决于每 token 激活参数,而非总参数
WildPino25 · reddit · 2026-07-29
这条 Reddit 帖子提出一个面向 CPU 推理的模型设计思路:解码速度取决于每 token 的激活参数量,而不是总参数量。
- 作者认为,如果生成过程受限于内存带宽,那么只要每个 token 只激活少量权重,模型就可以在不明显拖慢推理速度的前提下继续扩大总容量。
- 他的架构尝试包含 三值权重、更细粒度的 MoE,以及其他稀疏化技巧,目标是把“激活参数/ token”压低。
- 初步测试显示,在 Ryzen 5 3600X 上,一个 8.3M 的 sandbox 模型吞吐从 176 tok/s 提升到 848 tok/s,代价只有很小的质量损失。
- 作者还在 Kaggle 上跑了一个 30M 模型训练,发现“用更大教师模型蒸馏”反而输给了直接用交叉熵训练,差距约 0.0116 BPB,于是把训练配方改成了 CE 优先。
- 目前超过 sandbox 的部分都还没训练完,10B 只是最终目标。
「研究」频道最新
- OpenRoboto 在 Bittensor 主网上线机器人模型竞赛 — const_reborn · 2026-07-29
- 微服务目录实测:Markdown、GraphRAG、MCP 图工具各有不同失效模式 — JeremyCMorgan · 2026-07-29
- Google Research 称微小脑样本揭示神经元可连 50 个突触 — GoogleAI · 2026-07-29
- 用 Claude 挑战量子信息难题,AI 推演后称需百万美元算力 — bronzeagepapi · 2026-07-29
- RLHF 书籍章节拆解 LLM 后训练中的 PPO、GRPO 和 REINFORCE — serrjoa · 2026-07-29
- Anthropic 的对齐伪装论文说明了什么,又没说明什么 — Passelume · 2026-07-29