自研引擎跑小米 1T 参数模型达 1300 tok/s
bookwormengr · x · 2026-09-30
bookwormengr 对 @bingxu 的引擎展示表示惊叹,后者回应称其自研推理引擎可运行小米的 1T 参数模型,吞吐达到 1300 tokens/s,附带演示视频。
该数字若属实,对超大 MoE 模型的端侧/本地推理速度是相当激进的表现,但帖内未披露引擎实现细节与硬件配置。
所属事件:两人团队用 AI 两周生成 20 个推理引擎,小米模型解码达 1300 tok/s(3 条相关)→
「Infra」频道最新
- 有人用 Rust 重写 Kafka 并塞进 Postgres,Kafgres 项目火了 — JiliJeanlouis · 2026-09-30
- Starlink 手机直连服务落地厄瓜多尔,覆盖亚马逊与加拉帕戈斯 — elonmusk · 2026-09-30
- OpenRouter 数据简报:token 用量爆发,开源模型支出半年涨 10 倍 — AccBalanced · 2026-09-30
- 观点:AI 算力不该全锁给大客户,要给初创留成长空间 — AccBalanced · 2026-09-30
- 黄仁勋:数据中心现在应改称「超级智能工厂」 — Polymarket · 2026-09-30
- Ollama 0.35 发布,支持 Nimble 模型 Mac 本地高速运行 — Technovangelist · 2026-09-30