96GB M3 Ultra 跑什么?Qwen3.5-122B-A10B 达约 1000 tok/s
infieldmitt · reddit · 2026-09-17
Reddit 用户询问 96GB 内存的 M3 Ultra Mac Studio 上本地模型怎么选,想要编码能力和情感化写作兼顾。作者吐槽当前模型要么约 30B 要么过大,曾同时跑两个 Qwen3 27B 实例(一个编码一个聊天)来吃满内存,但意识到 MoE 模型预处理极快、切线程上下文开销小,双实例意义不大。刚下载了 Qwen3.5-122B-A10B,速度高达约 1000 tok/s,理解提示词比小模型更透彻,但担心「3.5」版本号是不是 inferior 或错过了什么创新,发帖求证。
「Infra」频道最新
- 钙钛矿或成美国太阳能翻身关键,效率天花板从30%升到45% — kyliebytes · 2026-09-17
- 编译器老兵复盘:移动浪潮终结同构计算,逼出 TPU/NPU 时代 — blelbach · 2026-09-17
- 从 x86 一统天下到架构碎片化:软件人将再度为硬件买单 — blelbach · 2026-09-17
- 低精度挖矿见底,硬件老兵称稀疏计算是 AI 下一个 10x — blelbach · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17
- 美联储三年来首次加息,抬高债务驱动 GPU 集群的融资门槛 — rohanpaul_ai · 2026-09-17