4070 Ti 跑 GPT-OSS 120B 达 21 tok/s:利用 MoE 缓存暴力魔改
JayB_Official · reddit · 2026-08-09
一位开发者利用 Codex 辅助,成功在仅有 12GB 显存的 RTX 4070 Ti 上本地运行了体积达 59GB 的 GPT-OSS 120B 模型,并实现了 21 tok/s 的生成速度。
核心实现思路:
- 利用 MoE 架构:将静态参数常驻内存,热门专家(Expert)放在 GPU,冷门专家放在 NVMe 固态硬盘。
- 动态缓存调度:按需将 SSD 中的专家流式加载到 GPU 缓冲区,并自适应地把高频使用的专家保留在 GPU 持久缓存中。
- 激进近似:在开启 16 个自适应热专家槽位并采用 top-1 近似模式后,速度飙升至 21.16 tok/s。
作者表示,这证明了通过“原始人式”的开源工具拼接,普通消费级硬件也能跑起超大参数模型。
「编程与Agent」频道最新
- bindureddy 预告开源 AI 编码工具:支持接入免费模型 — bindureddy · 2026-08-09
- 15 种 AI 智能体设计模式详解:从单智能体到多智能体编排 — MaryamMiradi · 2026-08-09
- swyx 举办“周末干掉 SaaS”黑客松,超 600 人报名 — GregKamradt · 2026-08-09
- 开源多智能体系统 freephdlabor:端到端自动产出科研论文 — tom_doerr · 2026-08-09
- LLM 推理优化全景指南:部署与加速的工程思维 — abhijithneil · 2026-08-09
- 开发者实测 Codex 多线程自主协同:指令分发让人惊叹 — KarelDoostrlnck · 2026-08-09