Qwen3.8-Flash-Next 跑通 256K 上下文:DDR4+Tesla T4 实测 16 tok/s

BusTiny207 · reddit · 2026-09-04

Reddit 用户在一台二手 Dell R740(2×Xeon Gold 6230、384GB DDR4、单张 Tesla T4 16GB)上,用 ikllama.cpp 跑 Unsloth 的 Qwen3.8-Flash-Next UD-Q4KXL(180B 总参数/6B 激活,111GB),实现 256K 上下文本地推理。

关键配置与结果:

帖子给出完整启动命令与踩坑细节,对想在旧服务器上低成本跑大上下文 MoE 模型的人参考价值很高。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →