24GB 显卡塞下 256K 上下文:Qwen3.8-27B 混合量化实测 50 tok/s

iam31337 · reddit · 2026-08-18

作者把 Qwen3.8-27B(含内嵌 MTP 层) 连同完整 262,144 token 上下文 塞进 24GB 的 RTX PRO 4000 Blackwell SFF,并保持可用精度与速度:

模型已发布在 HuggingFace,完整张量配方、llama.cpp 补丁、运行参数与失败实验见博客。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →