87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s
CurieuxExplorer · x · 2026-10-01
日本用户实测本地推理工具「Strata」:容量 87GB 的 Qwen3.8 Flash Next 在单张 RTX 5090 上以 120150 t/s 速度运行(Prefill 达 4K t/s)。接入 LibreChat 并开启 Web 搜索后可正常检索,且该模型护栏宽松。评论认为「需要数据中心」的时代受到冲击,Qwen 级模型已成桌面级玩法。
「Infra」频道最新
- Arduino 称每节点远低于 Mac mini,嵌入式板卡改写 AI Agent 部署经济账 — CatAstro_Piyush · 2026-10-01
- SemiAnalysis 注入故障实测:GPU 集群租赁商可靠性差距悬殊 — AccBalanced · 2026-10-01
- Reddit网友跑DeepSeek无人值守循环:2.37亿token仅花3.48美元 — dogfoodarchitect · 2026-10-01
- 基于 Cornell 教程为团队自制 GPU 架构入门课程 — idanbeck · 2026-10-01
- Qwen Flash Next MTP 工作重启,官方 GGUF 量化与 llama.cpp PR 上线 — jacek2023 · 2026-10-01
- Strata 采样参数冷知识:run 配置里可加 sampling 块设默认值 — KissMyShinyArse · 2026-10-01