MiMo-V2.6-Flash 工具调用翻车?三个 vLLM 服务端 bug 及修复

mamolengo · reddit · 2026-09-23

作者在 2× DGX Spark 上用 vLLM 跑 MiMo-V2.6-Flash-RL 作为 agent 后端时发现,社区抱怨的「工具调用不好用」多数是服务端 bug 而非模型问题,共三个可修的问题:

1. 开 thinking + 多轮 + 流式时回复为空

2. 工具循环中模型丢失自己早先的推理

3. 隐藏的 2,048 token 输出上限(正文被截断,标题已点明存在此问题)

结论:换去 GLM-5.3-Flash 之前,先排查 serving 层,多数「模型问题」其实可修。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →