CPU 原生 LLM 试验过四关,跨词表蒸馏仍输给交叉熵
WildPino25 · reddit · 2026-07-21
作者在免费 Kaggle T4 上把一套 CPU-native LLM 训练流程完整跑了一遍,参数规模只有 30M,并且在启动前就把 5 个预注册门槛写进 git,避免事后改标准。
- 4 个门槛通过:三元量化开关可用、流水线能在十几次 session 杀死后恢复、多卡扩展达到 1.80×,长上下文回忆层稳定但没有带来性能增益。
- 最看好的点失败了:作者想做跨 tokenizer 蒸馏,学生词表只有 1024,教师和学生词表不一致,朴素映射只保留了约 15% 的教师信息;后来用一个 chain-rule 修正把信息保留率拉回到 83–86%,且不增加额外算力。
- 但即便如此,普通 cross-entropy 仍然全程胜出。
- 作者也明确了一个重要干扰项:教师模型是代码模型,却拿来给儿童故事打分,所以这只是跨 tokenizer、且离域的蒸馏测试,不能直接推出“蒸馏已死”。
- 另一个新发现是,MoE upcycle 会让蒸馏分支额外损失 +0.054 BPB,而且没有在后续赚回来,这被单独列为后续研究。
- 下一步是更真实的一层:30M 总参数 / 11M 激活参数、用 Python 训练的模型,预注册规则已经公开。
「研究」频道最新
- 研究发现记忆压缩会让智能体丢掉安全规则,违规率高达 59% — gerardsans · 2026-07-22
- DriftWorld 宣称世界模型可跑 30+ FPS 且仅需 1–2 张 GPU — du_yilun · 2026-07-22
- 1GW 中国 AI 数据中心为何并非不可能 — teortaxesTex · 2026-07-22
- 中国 AI 实验室把蒸馏混淆当成头号研究主题 — pmddomingos · 2026-07-22
- RSS 加入 OMSF,推进结构生物学大规模数据建模 — MoAlQuraishi · 2026-07-22
- enFoldX 用 AlphaFold3 结构噪声预测 TCR 识别 — quaidmorris · 2026-07-22