Kimi K3 论文披露 SFT 数据合成、XTLM 模板与 QAT 训练
stochasticchasm · x · 2026-07-28
这段论文截图讲的是 Kimi K3 的监督微调(SFT)阶段。
- 团队在此前 Kimi 系列的基础上,扩展了 SFT 数据集,并通过多轮验证和人工参与标注,合成更复杂的 agentic 轨迹。
- 为了统一这些复杂轨迹的表示,作者使用了基于 XTLM 的 chat template(Extensible Token Markup Language)来序列化全部数据。
- 论文还提到,从 SFT 阶段起就引入 QAT(量化感知训练),采用 MXFP4 权重 和 MXFP8 激活值,以兼顾训练与部署效率。
所属事件:Kimi K3 技术报告解读:万亿参数与后训练创新(4 条相关)→
「模型」频道最新
- k3 没改 RL 算法,工具调用步骤却几乎和分数 1:1 对齐 — stochasticchasm · 2026-07-28
- DeepInfra 上线 Claude Opus 5,支持 100 万上下文和新价格 — gharik · 2026-07-28
- Kimi K3 登上 OpenRouter,第三方供应商开始抢接入 — scaling01 · 2026-07-28
- Kimi K3 登陆 Applied Compute,支持训练与推理 — rhythmrg · 2026-07-28
- 转发文章称 Anthropic Opus 5 实测退化明显 — rickasaurus · 2026-07-28
- Polymarket 给予 Moonshot 9 月前再发 Kimi K 概率 76% — Polymarket · 2026-07-28