4070 Ti 跑 GPT-OSS 120B 达 21 tok/s:利用 MoE 缓存暴力魔改

JayB_Official · reddit · 2026-08-09

一位开发者利用 Codex 辅助,成功在仅有 12GB 显存的 RTX 4070 Ti 上本地运行了体积达 59GB 的 GPT-OSS 120B 模型,并实现了 21 tok/s 的生成速度。

核心实现思路:

作者表示,这证明了通过“原始人式”的开源工具拼接,普通消费级硬件也能跑起超大参数模型。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →