Kimi K3 规模训练优化:每 GPU 节省 90GB 显存
AccBalanced · x · 2026-08-30
在 Kimi K3 这种规模下,内存直接决定了训练所需的 GPU 数量。主要优化点包括:
- 流式梯度更新:用于 Adam 更新,使主机内存峰值降低约 33%。
- SiTU-GLU 激活优化:原生 autograd 会保存冗余张量,在每 GPU 约 10 万 token 的情况下会消耗超过 100GB HBM。通过定制的流式算子使用固定大小的工作区,每 GPU 可节省约 90GB HBM。
所属事件:Kimi K3全量微调上线AC2 单副本GPU需求降40%(3 条相关)→
「Infra」频道最新
- 沙特 AI 公司合建红海 100 兆瓦数据中心 — Polymarket · 2026-09-01
- 32GB 内存+两块杂牌旧卡跑 Qwen3 27B,20t/s 本地编程可行但太慢 — pepijndevos · 2026-09-01
- 字节跳动 UBASE:万亿级向量数据的 AI 搜索引擎 — _reachsumit · 2026-09-01
- LinkedIn 提出基于 GPU 的语义检索框架 — _reachsumit · 2026-09-01
- REIGN 实现长文档检索的高效上下文扩展 — _reachsumit · 2026-09-01
- Ollama 推出透明按 Token 计费,Pro 套餐含 60 美元额度 — ollama · 2026-09-01