Bonsai 量化版 24GB 卡跑出 128k 上下文 50 tok/s,速度翻倍
julianharris · x · 2026-09-18
作者实测 Bonsai 量化模型,速度与体积均优于其常用的 Qwen 量化版本。
- 在 4090/24GB 显卡上满载 128k 上下文可达 50 tok/s,此前仅 32 tok/s
- 速度提升后可在单张 24GB 卡上同时跑两个会话
- 预计 256k 满上下文时约 25 tok/s
- 作者提到应有 drafted with Bonsai 的版本,可进一步提升性能,但尚未找到
所属事件:Bonsai 量化模型实测:24GB 卡 128k 上下文跑出 50 tok/s(2 条相关)→
「Infra」频道最新
- 对冲基金经理:Anthropic 每 token 成本远低于 OpenAI — rohanpaul_ai · 2026-09-18
- 工程师爆料:企业根本数不清自己有多少台服务器,有人干脆藏机器 — irth7 · 2026-09-18
- SK 海力士旗下 Solidigm 拟在美国建 NAND 闪存厂 — zephyr_z9 · 2026-09-18
- 华为轮值董事长:2027 年国内 AI 训练将大规模转向昇腾 950DT — pstAsiatech · 2026-09-18
- Jev playground 显示推理与往返延迟,欧洲访问多付 120ms — DanielLockyer · 2026-09-18
- HEIF Heist 漏洞波及 OpenAI、Slack、Meta,一个图像库撼动全网 — tszzl · 2026-09-18