Agentic kernel 优化把 Kimi 类模型速度从 65 提到 406 tok/s

xenovatech · reddit · 2026-07-25

这条帖子展示了一次 agentic kernel optimization:一群 GPT-5.6 Sol agents 用了 40 多小时,把一个类似 Kimi K3 的模型从 65 tok/s 优化到 406 tok/s。

配图和文字说明了优化过程:他们不断 融合算子、重构执行图,把一个完全拆解的 331 节点 Kimi Linear graph 压缩到每个 token 只需要 22 次 GPU dispatch。主要收益来自针对 KDA、MLA、MoE 的自定义 WebGPU kernels;作者还说后续会完整发布这套优化框架。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →