自研引擎跑小米 1T 参数模型达 1300 tok/s

bookwormengr · x · 2026-09-30

bookwormengr 对 @bingxu 的引擎展示表示惊叹,后者回应称其自研推理引擎可运行小米的 1T 参数模型,吞吐达到 1300 tokens/s,附带演示视频。

该数字若属实,对超大 MoE 模型的端侧/本地推理速度是相当激进的表现,但帖内未披露引擎实现细节与硬件配置。

所属事件:两人团队用 AI 两周生成 20 个推理引擎,小米模型解码达 1300 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →