8B 模型跑上手机 CPU:Exploit 峰会实测 60 tokens/秒
const_reborn · x · 2026-09-29
在 Exploit 大会上,@jondurbin 报告了一个 8B 模型在手机 CPU 上运行的实测结果:无需 GPU 或 NPU,即达到约 60 tokens/秒的生成速度。
测试通过 Qualcomm Device Cloud 租用真机完成,且这是尚未做任何优化工作之前的原始成绩。若后续针对移动端做量化与调度优化,本地大模型的手机体验还有明显提升空间。
「Infra」频道最新
- Agent 90 分钟跑 322 个 Hugging Face Jobs,总账单仅约 4 美元 — victormustar · 2026-09-29
- 超8万个代理服务器隐藏流向,被盗AI订阅凭据催生黑产经济 — ChuckDBrooks · 2026-09-29
- antirez:本地推理别只看生成速度,缩短思考阶段与加速 prefill 才是关键 — antirez · 2026-09-29
- 投资人呼吁建「算力长城」,输出智能而非美元 — McDonaghMatthew · 2026-09-29
- 用 Claude Code 指挥本地模型干活,省云端额度的混合工作流可行吗? — Ambitious_Fold_2874 · 2026-09-29
- 两台 DGX Spark 跑 320B MoE 模型,262K 上下文前要先修 11 个坑 — TechPreacher · 2026-09-29