Kimi 联合 AMD 优化 MI355X 服务栈,TTFT 降 3.2 倍
AnushElangovan · x · 2026-07-23
Kimi 和 AMD 表示,他们针对 agent 工作负载重构了 Kimi K2.6 在 AMD Instinct MI355X 上的服务栈,以应对长上下文、突发流量和频繁工具调用。
这次优化引入了 感知调度的多层 KV 缓存,并宣称实现了最高 3.2× 更低的 p99 TTFT 和 7.7% 更高的总 token 吞吐,且不牺牲准确率。原帖同时给出了技术博客链接供进一步阅读。
「Infra」频道最新
- Pinokio 8.0.40 热修复 Hugging Face token 失效问题 — cocktailpeanut · 2026-07-23
- 开发者反思本地算力投资:预付费工作站大幅降低实验摩擦 — generativist · 2026-07-23
- Kimi-K3 被估算为 50.4B 激活参数 — StefanoGogioso · 2026-07-23
- 开源模型可能把利润从模型层转向基础设施层 — matt_slotnick · 2026-07-23
- Graphsignal 用 GPU 遥测自动调优 vLLM 和 SGLang 参数 — l0g1cs · 2026-07-23
- 白宫为 Genesis Mission 投入超 50 亿美元,微软谷歌同步给算力 — ns123abc · 2026-07-23