AMD 7900 XT 跑 Gemma 模型掉速:131K 上下文成性能瓶颈

opoot_ · reddit · 2026-08-13

一位用户在 Windows 系统下使用 LM Studio 运行 Gemma 模型(131K 上下文,KV cache 量化),尽管显存足够,但生成速度异常缓慢(仅 14 TPS)。

该用户推测 Windows 系统环境可能是导致掉速的原因之一,并向社区寻求进一步的优化思路与解决方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →