4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B

ImBadGuyInEveryStory · reddit · 2026-09-27

发帖人自研推理引擎,在 RTX 2050(4GB 显存)+ 16GB 内存的笔记本上从 SSD 流式加载 35B 的 Ornith 1.5,跑出约 9.4 tok/s,反而快于 LM Studio 里 GPT-OSS 20B 的约 6 tok/s。他想知道是否有 80GB 以下、Q4 左右的剪枝版顶级开源 MoE(如 Kimi K3)适合网页开发场景,也想了解剪枝 mimo v2.6 之类旧模型的可行办法。属于端侧部署的实用讨论。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →