96GB M3 Ultra 跑什么?Qwen3.5-122B-A10B 达约 1000 tok/s

infieldmitt · reddit · 2026-09-17

Reddit 用户询问 96GB 内存的 M3 Ultra Mac Studio 上本地模型怎么选,想要编码能力和情感化写作兼顾。作者吐槽当前模型要么约 30B 要么过大,曾同时跑两个 Qwen3 27B 实例(一个编码一个聊天)来吃满内存,但意识到 MoE 模型预处理极快、切线程上下文开销小,双实例意义不大。刚下载了 Qwen3.5-122B-A10B,速度高达约 1000 tok/s,理解提示词比小模型更透彻,但担心「3.5」版本号是不是 inferior 或错过了什么创新,发帖求证。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →