DSv4 Flash 超长上下文下的工具调用稳定性问题

captaintobs · reddit · 2026-08-21

用户在 4 个 Spark 实例上使用 jasl/vllm 运行 DSv4 Flash 模型时发现,当上下文超过 10 万 tokens 后,模型开始出现工具调用失败(如漏掉字符 '>')。虽然模型吞吐量很高(单实例 50 tps,聚合 >100 tps),但稳定性不足。相比之下,GLM 5.2 更准确但速度较慢(25 tps)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →