Bonsai 量化模型实测:24GB 卡 128k 上下文跑出 50 tok/s
开发者 julianharris 实测 Bonsai 量化模型,发现其速度与体积均优于常用的 Qwen 量化版本:在 RTX 4090(24GB 显存)上满载 128k 上下文可达 50 tok/s,而此前仅约 32 tok/s,速度近乎翻倍,且单卡可同时运行两个实例,展现了消费级显卡运行长上下文模型的新可能。
2026-09-18 ~ 2026-09-18 · 2 条相关
- Bonsai 量化模型 128k 上下文跑出 50 tok/s,24GB 卡可双开 — julianharris · 2026-09-18
另有 1 条近重复转述:julianharris