Tesla V100 跑 Qwen3.6 27B 实测:128K 上下文配置与性能分享

Traditional_Bell8153 · reddit · 2026-08-08

一位开发者在 Reddit 社区分享了在 Tesla V100 PCIE 32Gb 显卡上运行 Qwen3.6 27B 模型的配置与性能表现。

该测试采用了 Q4KM 量化的主模型配合 Q80 的多令牌预测(MTP)草案模型,在 128K 的超长上下文下进行了调优。帖文中详细列出了基于 llama.cpp 的各项核心参数配置,包括开启了 Flash Attention、特定的线程与批次大小设置等,并附带了具体的性能跑分截图,旨在寻求更多 V100 用户的经验交流。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →