Qwen 35B 在手机上跑起来了
Severe_Post_2751 · reddit · 2026-07-18
作者在 Samsung S26 Ultra 上测试一个私有的 Qwen 35B MoE 运行时,声称在不牺牲精度的前提下,激活后的模型占用可以塞进设备内存限制内。
他给出的早期结果是:经过优化后,输入处理大约 90 tokens/s,而输出生成约 8 tokens/s。作者强调自己是出于兴趣自学 AI/ML、没有正式 PhD,也提到手上有算力和资源继续测试,并希望有人一起参与;同时他还说自己投过 4 篇 arXiv 论文,但因为没有机构背景仍在审核中。
「Infra」频道最新
- Oracle Q1 云基建收入三位数增长,AI 算力需求持续爆发 — DavidLinthicum · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11