Qwen 3.8 27b 配 DeepSeek Harness 实测:10 小时稳定运行,37-60 tok/s

cviperr33 · reddit · 2026-08-16

Reddit 用户分享使用 Qwen 3.8 27b 与 DeepSeek Harness(DSH)的体验。在 RTX 3090 上,模型运行 10 小时无错误,自动压缩上下文,不偏离目标,一次性解决所有问题。速度方面,上下文增长时约 37 tok/s,新提示约 50 tok/s,Unsloth Studio 新对话约 56-60 tok/s。使用 UD q4 k xl 量化 + vision F16,上下文 92k,MTP + ngram 启用,GPU 层 66。用户认为默认使用 xHigh 思考模式,有时思考长达 20 分钟。期待 35b MoE 模型,因为当前密集模型需要 16GB+ 显存,无法 CPU 卸载。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →