4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B
ImBadGuyInEveryStory · reddit · 2026-09-27
发帖人自研推理引擎,在 RTX 2050(4GB 显存)+ 16GB 内存的笔记本上从 SSD 流式加载 35B 的 Ornith 1.5,跑出约 9.4 tok/s,反而快于 LM Studio 里 GPT-OSS 20B 的约 6 tok/s。他想知道是否有 80GB 以下、Q4 左右的剪枝版顶级开源 MoE(如 Kimi K3)适合网页开发场景,也想了解剪枝 mimo v2.6 之类旧模型的可行办法。属于端侧部署的实用讨论。
「Infra」频道最新
- 托管推理三大迷思:单价不是账单、端点不可互换、自建未必省 — TangeloOk9486 · 2026-09-27
- Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选 — jiqizhixin · 2026-09-27
- 自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路 — A_K_Nain · 2026-09-27
- TensorSharp 开源框架支持单请求混合文档/图像/视频/音频证据 — fuzhongkai · 2026-09-27
- 智库学者反数据中心抗议者现场交锋,为算力建设辩护 — neil_chilson · 2026-09-27
- Kafka 上生产才见真章:分区倾斜与消费滞后成大坑 — goyalshaliniuk · 2026-09-27