8B 模型跑上手机 CPU:Exploit 峰会实测 60 tokens/秒

const_reborn · x · 2026-09-29

在 Exploit 大会上,@jondurbin 报告了一个 8B 模型在手机 CPU 上运行的实测结果:无需 GPU 或 NPU,即达到约 60 tokens/秒的生成速度。

测试通过 Qualcomm Device Cloud 租用真机完成,且这是尚未做任何优化工作之前的原始成绩。若后续针对移动端做量化与调度优化,本地大模型的手机体验还有明显提升空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →