252 美元单卡预训练迷你 Kimi,免费电子书全记录
joecole · x · 2026-08-21
MIT 博士 Raj Dandekar 发布免费电子书《Pretraining a Mini Kimi K3》,详细记录了在单张 H200 上花费 252.35 美元,使用 50 亿 token 从零预训练 10.2 亿参数(激活 1.45 亿)Kimi K3 复刻版的完整过程。
核心内容:
- 架构复刻:逐行拆解官方 K3 配置,讲解如何将 2.8 万亿参数模型缩小至单卡可训练,保留 9 层 KDA + 3 层 MLA 注意力堆栈及 top-6 MoE 路由。
- 数据处理:使用 1048 亿 token 语料,通过 13-gram 匹配对 8 个 benchmark 去污染,支持断点续训。
- 排坑实录:修复官方代码中 4 个未文档化的运行阻碍,解决 MoE 路由在第 20 步杀掉 94.5% 专家的问题,并记录 3 个隐形的分布式训练 bug。
- 优化尝试:记录 16 次 MFU(模型算力利用率)提升尝试,仅 3 次成功;发现 FP8 和更大 GPU 反而导致性能下降的反直觉现象。
- 结果评估:Loss 从 12.10 降至 2.62,包含 24 次跨训练过程的 benchmark 评测。
「Infra」频道最新
- Langship:像 Terraform 一样部署 AI Agent 的开源工具 — Many_Audience7660 · 2026-08-21
- Qwen3.8-27B 现支持 NVFP4 与 DFlash2 量化部署 — Alibaba_Qwen · 2026-08-21
- 求教:双卡 P100 跑 Qwen 27B 量化版体验如何? — kirisoraa · 2026-08-21
- 130 年算力性价比提升 10²² 倍,Kurzweil 图表引热议 — Singularitarian · 2026-08-21
- Wake:统一 13 款 Code Agent 会话的 macOS 原生工具 — aigclink · 2026-08-21
- 设置 CPU Limit 会让 K8s 应用变慢?这里有复现实验与证明 — JeremyCMorgan · 2026-08-21