开源项目 Strata 让 RTX 4090 跑 125B 模型,速度达 100 tokens/s
snehesht · hn · 2026-10-04
HN 热帖:开源项目 Strata 宣称可在 RTX 4090 等消费级显卡上以约 100 tokens/s 的速度运行 125B 参数的 Qwen 3.8 Flash Next 模型,面向本地部署场景。项目代码已在 GitHub 开源。
「Infra」频道最新
- 开源工具 llm-inference-bench 力推本地 LLM 推理测速统一标准 — TheZachMueller · 2026-10-04
- 从一张 3090 到 20 台 DGX Spark:家庭本地推理集群的完整进化史 — ciprianveg · 2026-10-04
- Anthropic 310亿美元数据中心落户昆士兰乡村,居民忧环境代价 — nordicinst · 2026-10-04
- 美国数据中心之争或成全球算力落地冲突的预演 — pstAsiatech · 2026-10-04
- RISC-V 芯片加速走向数据中心,美中合作在芯片对抗下持续加深 — pstAsiatech · 2026-10-04
- Thoughtworks 工程师实测四周:本地模型写代码到底行不行 — bibryam · 2026-10-04