DSv4 Flash 超长上下文下的工具调用稳定性问题
captaintobs · reddit · 2026-08-21
用户在 4 个 Spark 实例上使用 jasl/vllm 运行 DSv4 Flash 模型时发现,当上下文超过 10 万 tokens 后,模型开始出现工具调用失败(如漏掉字符 '>')。虽然模型吞吐量很高(单实例 50 tps,聚合 >100 tps),但稳定性不足。相比之下,GLM 5.2 更准确但速度较慢(25 tps)。
「模型」频道最新
- Qwen 3.8 模型陷入过度思考的有趣瞬间 — AciD1BuRN · 2026-08-21
- 神秘模型 Ox Alpha 实测疑为智谱 GLM 新版本 — teortaxesTex · 2026-08-21
- OpenRouter 匿名模型 Ox Alpha 上线,网友猜测国内厂商 — lxfater · 2026-08-21
- Ox Alpha 模型实测:Minecraft 表现惊艳 — max_paperclips · 2026-08-21
- 博主评测疑似 1T 模型:推理风格趋同,像 GLM 5.3 与 V4-Flash 混合体 — teortaxesTex · 2026-08-21
- 实测对比:DeepSeek v4 Flash 体验优于 Qwen3.8-27B — MikePFrank · 2026-08-21