开源引擎 Strata 让游戏 PC 本地跑 125B 大模型
开源推理引擎 Strata 由单人开发者打造,让 1250 亿参数的 Qwen3.8-Flash-Next 能在普通游戏 PC 上本地运行,上线 8 天即获 5000+ GitHub stars(后续转发帖显示已升至 5.7k),成为本周本地推理领域的焦点。安全研究者与多国普通用户独立实测均验证了可行性与吞吐表现,入门门槛远低于预期。
已确认
- Strata 支持 Windows/Linux 一键安装,双击一个文件即可完成,并在消费级硬件上运行 125B 参数的 Qwen3.8-Flash-Next,本地提供 OpenAI/Anthropic 兼容 API,可直接接入 Claude Code(@alexverem)
- 核心机制是通过 GPU/CPU 分工与分层存储,不把整个模型装进显存,使 125B 级 MoE 模型能在 RTX 5070 12GB 这类消费级 GPU 上本地运行(@udmrzn,转发)
- 安全研究者 evilsocket 演示在一张 16GB 显存的 NVIDIA GPU 上运行 IQ1M 极致量化版 qwen3.8-flash-next-coder,称硬件门槛约为一张 12-24GB 显存的显卡(@evilsocket)
- 日本用户 CurieuxExplorer 实测:87GB 的 Qwen3.8 Flash Next 在单张 RTX 5090 上以 120150 t/s 速度运行,Prefill 达 4K t/s,已接入 LibreChat 并开启 WebUI(@CurieuxExplorer)
- 转发信息显示,一台搭载老旧便宜 DDR3 内存的电脑也可运行该 1250 亿参数模型,速度达 70 t/s(@udmrzn,转发)
为什么重要
- 大参数模型本地部署通常依赖高端服务器或多卡集群,Strata 通过极致量化、GPU/CPU 分工与分层存储把门槛压到 12-16GB 显存甚至 DDR3 旧电脑,对隐私敏感场景与离线开发工作流有实际价值
- 项目提供 OpenAI/Anthropic 兼容 API,Claude Code、LibreChat 等现有 AI 工具链可直接切换到本地模型,切换成本极低
- 从安全研究者到普通用户的独立实测覆盖不同硬件档位,验证了可用性与吞吐表现,说明性能并非理想环境下的宣传数字
2026-10-01 ~ 2026-10-03 · 7 条相关
一手来源
- Strata 开源项目让游戏 PC 一键跑 Qwen3.8-Flash-Next,8 天获 5000 星 — alex_verem ·
- 16GB 老显卡跑 Qwen3.8 Coder,Strata 极致量化显神通 — evilsocket ·
- 87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s — CurieuxExplorer ·
- 【源头】87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s — CurieuxExplorer · 2026-10-01
- 【源头】16GB 老显卡跑 Qwen3.8 Coder,Strata 极致量化显神通 — evilsocket · 2026-10-01
- 开源 Strata:16GB 显存本地跑 125B 的 Qwen3.8-Flash-Next — evilsocket · 2026-10-01
- 【源头】Strata 开源项目让游戏 PC 一键跑 Qwen3.8-Flash-Next,8 天获 5000 星 — alex_verem · 2026-10-02
- Strata 仓库详情:消费者硬件跑 125B 模型,支持 OpenAI/Anthropic 本地 API — alex_verem · 2026-10-02
- Strata 开源推理引擎:老旧 DDR3 电脑跑 1250 亿参数模型达 70tps — udmrzn · 2026-10-03
- 开源推理引擎 Strata:12GB VRAM 跑 125B MoE 模型,可达 93 tokens/s — udmrzn · 2026-10-03