TensorSharp 跑 Qwen 3.8 Flash Next 性能实测

fuzhongkai · reddit · 2026-09-01

在双 A100 环境下对比 TensorSharp 与 llama.cpp 运行 Qwen 3.8 Flash Next (UD-Q2KXL 量化) 的性能。数据显示,在长提示词处理 (pp2048) 上 TensorSh arp 领先明显 (单卡 1.44倍,双卡 1.35倍),但在短提示词和生成阶段 (tg64) 略逊于 llama.cpp。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →