16 t/s 难应付编码,本地推理仍受限
natesiggard · x · 2026-08-26
作者列举了本地推理的适用场景(整理 25 年的媒体库、Obsidian 笔记、会计记账),但认为目前 16 t/s 的速度无法满足每天 12 小时以上的编码需求。评论区补充称,在 M3 Ultra (512GB) 上运行 GLM5.2 和 Qwen 3.8 27B 时,速度分别受限在 16 t/s 和 30 t/s 以下,期待 M5 能带来翻倍提升。
所属事件:M3 Ultra 本地跑大模型,速度仍难胜任编码(2 条相关)→
「Infra」频道最新
- vLLM 实现 1T 参数模型分片传输,耗时仅 7.53 秒 — TheZachMueller · 2026-08-26
- 分析师:OpenAI 与 Anthropic 验证自研芯片必要性 — BenBajarin · 2026-08-26
- 跑提示词其实不需要买 Mac Studio — rudrank · 2026-08-26
- 分析师解读 OpenAI Jalapeno:混合云或为长期战略 — BenBajarin · 2026-08-26
- Arduino 推出 VENTUNO Q:40 TOPS NPU 本地跑 LLM — ryanshrout · 2026-08-26
- OpenAI 推广 Jalapeño 支持开源模型,或仿谷歌售硬件 — BenBajarin · 2026-08-26