Qwen 35B 在手机上跑起来了

Severe_Post_2751 · reddit · 2026-07-18

作者在 Samsung S26 Ultra 上测试一个私有的 Qwen 35B MoE 运行时,声称在不牺牲精度的前提下,激活后的模型占用可以塞进设备内存限制内。

他给出的早期结果是:经过优化后,输入处理大约 90 tokens/s,而输出生成约 8 tokens/s。作者强调自己是出于兴趣自学 AI/ML、没有正式 PhD,也提到手上有算力和资源继续测试,并希望有人一起参与;同时他还说自己投过 4 篇 arXiv 论文,但因为没有机构背景仍在审核中。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →