12GB 显存跑 Qwen3.8 量化版:解码 20-30 tok/s,131k 上下文
bodhi371 · reddit · 2026-10-09
作者分享在 12GB VRAM + 32GB 内存 + NVMe SSD 上运行 Qwen3.8-Flash-Next-GSQ-RCO-Abliterated(IQ3S 量化)的实测:解码 20-30 tok/s(Q2 量化可达 39-45 tok/s),131k 上下文下 prefill 达 300 至约 9 万 tok/s。
所用为 Strata 的自定义 fork,包含大量实验性架构改动(可能不稳定),整体硬件成本不到 2000(美元/元原帖未明示)。作者称某些方面"有本地 Opus 的感觉"。附 GitHub 配方与 fork 仓库链接。
「Infra」频道最新
- 亚马逊跟进微软宣布弃用数据中心交易保密协议,社区反对已致数百项暂停令 — TechCrunch AI · 2026-10-10
- 亚马逊放弃数据中心保密协议,同时 AI agent 开始接管用户信用卡 — TechCrunch AI · 2026-10-10
- SkyPilot 创始人谈算力困局:囤卡闲置 GPU 年烧超 2000 万美元 — skypilot_org · 2026-10-10
- uv 二进制体积减 40%,每月为公共镜像省近 4 PB 流量 — charliermarsh · 2026-10-10
- Firmus 300 亿美元 IPO 流产,仅 46MW 投产却估值两年涨两倍 — kevinsxu · 2026-10-10
- 超大规模云厂商债券已占美国国债净新增借款可观比例 — matt_slotnick · 2026-10-10