16 t/s 难应付编码,本地推理仍受限

natesiggard · x · 2026-08-26

作者列举了本地推理的适用场景(整理 25 年的媒体库、Obsidian 笔记、会计记账),但认为目前 16 t/s 的速度无法满足每天 12 小时以上的编码需求。评论区补充称,在 M3 Ultra (512GB) 上运行 GLM5.2 和 Qwen 3.8 27B 时,速度分别受限在 16 t/s 和 30 t/s 以下,期待 M5 能带来翻倍提升。

所属事件:M3 Ultra 本地跑大模型,速度仍难胜任编码(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →