Qwen3.8-Flash-Next 跑通 256K 上下文:DDR4+Tesla T4 实测 16 tok/s
BusTiny207 · reddit · 2026-09-04
Reddit 用户在一台二手 Dell R740(2×Xeon Gold 6230、384GB DDR4、单张 Tesla T4 16GB)上,用 ikllama.cpp 跑 Unsloth 的 Qwen3.8-Flash-Next UD-Q4KXL(180B 总参数/6B 激活,111GB),实现 256K 上下文本地推理。
关键配置与结果:
- 512 个 expert 全部驻留主机内存(-cmoe),非 expert 权重放 T4(4606 MiB)
- 将 -ctv 和 -ictk 从默认 f16 量化到 q80、-ub 从 2048 降到 1024,是 256K 上下文能塞进 13GB 显存的关键
- 256K 上下文下 prompt 处理 159.6 t/s,生成 16-17.6 t/s;-ub 1024 略降 prompt 速度但不影响生成;128K 扩到 256K 仅损失约 2.5% 生成速度
- 实际表现:完成了一次代码重构,答对了几个偏门的 Nim 编程题,输出比 Opus 更简洁
帖子给出完整启动命令与踩坑细节,对想在旧服务器上低成本跑大上下文 MoE 模型的人参考价值很高。
「编程与Agent」频道最新
- 社媒监听工具 Stalkr 上线即获客,创始人晒 10 分钟实绩 — marclou · 2026-09-04
- HarnessEvolve:让智能体像调试代码一样自我改进 — rohanpaul_ai · 2026-09-04
- GPT-6 Astra 评测汇总:单任务成本减半,但思维链监控失效 — vista8 · 2026-09-04
- 1360 次实测:本地 LLM 搭配五大编码 Agent 框架谁更强,初步基准出炉 — PMinervini · 2026-09-04
- 港科大广州×腾讯开源 VibeWorlding:对话式端到端搭建 3D 世界 — jiqizhixin · 2026-09-04
- ChatGPT 隐藏技巧:编辑旧消息即可手动压缩项目长对话上下文 — Ok_Negotiation_2587 · 2026-09-04