Agentic kernel 优化把 Kimi 类模型速度从 65 提到 406 tok/s
xenovatech · reddit · 2026-07-25
这条帖子展示了一次 agentic kernel optimization:一群 GPT-5.6 Sol agents 用了 40 多小时,把一个类似 Kimi K3 的模型从 65 tok/s 优化到 406 tok/s。
配图和文字说明了优化过程:他们不断 融合算子、重构执行图,把一个完全拆解的 331 节点 Kimi Linear graph 压缩到每个 token 只需要 22 次 GPU dispatch。主要收益来自针对 KDA、MLA、MoE 的自定义 WebGPU kernels;作者还说后续会完整发布这套优化框架。
「Infra」频道最新
- PyTorch Foundation 将 vLLM、DeepSpeed 和 Ray 纳入中立 AI 技术栈 — PyTorch · 2026-07-25
- Lightning AI 称其互连速度已超过裸金属方案 — LightningAI · 2026-07-25
- Lightning Cloud 支持 S3 并优化多节点训练速度 — LightningAI · 2026-07-25
- Kimi K3 几天后将在 Nebius 上线 — demian_ai · 2026-07-25
- SmolVM 宣布 macOS 沙盒功能即将上线 — aniketmaurya · 2026-07-25
- AMD MI455X 把 Instinct 从拼芯片转向拼机架 — AccBalanced · 2026-07-25