Bonsai 量化模型 128k 上下文跑出 50 tok/s,24GB 卡可双开
julianharris · x · 2026-09-18
julianharris 实测发现 Bonsai 量化模型比他常用的 Qwen 量化版更快更小:在 4090/24GB 上 128k 上下文满载跑出 50 tok/s(此前 32 tok/s),速度快到可以同时开两个会话;预计 256k 满上下文约 25 tok/s。结论是消费级单卡本地大上下文推理体验已大幅提升。
所属事件:Bonsai 量化模型实测:24GB 卡 128k 上下文跑出 50 tok/s(2 条相关)→
「Infra」频道最新
- 算力中端市场缺标准层:1000 万至 1 亿美元级部署何时能标准化交易 — AccBalanced · 2026-09-18
- 已规划数据中心达 342GW,是现装机的近 7 倍,隐含 26 万亿美元开支 — BenBajarin · 2026-09-18
- Hyperbolic 招量化研究员:要把 GPU 算力做成可交易资产 — YiMaTweets · 2026-09-18
- 算力公司 Crusoe 融资 39 亿美元,估值达 309 亿 — beffjezos · 2026-09-18
- Periodic Labs 仅用 1300 块 H200 训出超 GPT-6 的科学模型 — hsu_byron · 2026-09-18
- Jeff Dean 力挺专用硬件:少数工作负载将占全球大部分算力 — AccBalanced · 2026-09-18