Inco AI 推理平台上线:Kimi K3 出字 287 tok/s,四款开源模型速度榜登顶
songhan_mit · x · 2026-09-04
Inco AI 推出面向智能体时代的推理平台,为 Kimi K3、MiniMax M3、GLM 5.3 和 GLM 5.3 Flash 提供高速端点,四款模型均登顶 Artificial Analysis 输出速度供应商榜首。具体成绩:Kimi K3 达 287 tok/s(为次快供应商的 2.0 倍)、MiniMax M3 达 417 tok/s(1.7 倍)、GLM 5.3 达 401 tok/s(1.3 倍)、GLM 5.3 Flash 达 458 tok/s(1.4 倍)。技术栈包括 GPU 集群级调度与缓存感知路由、自研 DFlash / DFlash 2 并行块扩散投机解码(已开源 checkpoint),以及 AWQ、ParoQuant 等量化研究成果。
「Infra」频道最新
- Starship 33 台猛禽同点火:7400 万牛顿推力两倍于土星五号 — PeterDiamandis · 2026-09-04
- xAI 孟菲斯获批第 5 座数据中心,耗资 4000 万美元换地 — chrisgrayson · 2026-09-04
- Mirai 推理引擎 uzu 发布投机解码,M5 上超 llama.cpp 3 倍 — TheMoonMidas · 2026-09-04
- 12GB 显存跑本地模型怎么选?作者力推 Gemma-4-12B — GlennCameronjr · 2026-09-04
- 圈内传闻:一家 AI 服务宕机,流量会压垮其他所有家 — jxnlco · 2026-09-04
- UBS:蚂蚁成博通第二大客户,分析师猜 OpenAI 将加深与联发科合作 — BenBajarin · 2026-09-04