RTX 5090 本地编码模型怎么选:Qwen 27B 200TPS 与 Flash 50TPS 之间找平衡

MasterNomie · reddit · 2026-09-28

一位在 RTX 5090 + 96GB DDR5 上跑本地模型的用户求助:Qwen 3.8 27B 编码能力尚可且解码超 200 TPS,但 Flash next 能力更强却只有约 50 TPS,他想要一个介于两者之间、解码速度在 75-100 TPS 的编码模型,并计划把内存升级到 128GB。若找不到合适模型,他考虑用 Flash next 做规划、27B 做实现的分工方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →