Kimi 联合 AMD 优化 MI355X 服务栈,TTFT 降 3.2 倍

AnushElangovan · x · 2026-07-23

Kimi 和 AMD 表示,他们针对 agent 工作负载重构了 Kimi K2.6 在 AMD Instinct MI355X 上的服务栈,以应对长上下文、突发流量和频繁工具调用。

这次优化引入了 感知调度的多层 KV 缓存,并宣称实现了最高 3.2× 更低的 p99 TTFT 和 7.7% 更高的总 token 吞吐,且不牺牲准确率。原帖同时给出了技术博客链接供进一步阅读。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →