Bonsai 量化模型 128k 上下文跑出 50 tok/s,24GB 卡可双开

julianharris · x · 2026-09-18

julianharris 实测发现 Bonsai 量化模型比他常用的 Qwen 量化版更快更小:在 4090/24GB 上 128k 上下文满载跑出 50 tok/s(此前 32 tok/s),速度快到可以同时开两个会话;预计 256k 满上下文约 25 tok/s。结论是消费级单卡本地大上下文推理体验已大幅提升。

所属事件:Bonsai 量化模型实测:24GB 卡 128k 上下文跑出 50 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →