AI 生成推理引擎实测:小米模型跑出 1300+ tok/s,称 AlphaGo 时刻
bingxu_ · x · 2026-09-30
两人团队 INT21 发布研究报告《An AlphaGo Moment for Inference?》,用 AI 自动生成推理引擎,两周内造出 20 个引擎,横跨 15 个模型与 SGLang、vLLM 对比:
- 小米 MiMo V2.6 Pro(约 8K 输入 → 1K 输出,8×B300):解码速度 1308 tok/s,远超 SGLang 的 540 与 vLLM 的 1011
- DeepSeek V4.1 Flash(8×B200):1844 tok/s,相比 SGLang(830)与 vLLM(791)加速 2.22×/2.33×
- GLM-5.3 与 GLM-5.3-Flash 上也领先,但部分工作负载下 INT21 首 token 延迟(如 1527 ms)抵消了解码优势
结论:AI 生成基础设施前景可观,但仍有未竟之处——不同工作负载、不同配置下表现差异明显,报告同时公布了全部测量数据。
所属事件:两人团队用 AI 两周生成 20 个推理引擎,小米模型解码达 1300 tok/s(3 条相关)→
「Infra」频道最新
- PyTorch 中国大会 2026 全部演讲视频已上线 YouTube — PyTorch · 2026-09-30
- 黄仁勋谈 AI 安全:围栏隔离加实时监控,安全与进步不是二选一 — XFreeze · 2026-09-30
- NVIDIA Vera CPU 实物送达开发者手中,已被用于跑 agentic 负载 — IanAndrewsDC · 2026-09-30
- 有人用 Rust 重写 Kafka 并塞进 Postgres,Kafgres 项目火了 — JiliJeanlouis · 2026-09-30
- Starlink 手机直连服务落地厄瓜多尔,覆盖亚马逊与加拉帕戈斯 — elonmusk · 2026-09-30
- OpenRouter 数据简报:token 用量爆发,开源模型支出半年涨 10 倍 — AccBalanced · 2026-09-30