MiMo-V2.6-Flash 工具调用翻车?三个 vLLM 服务端 bug 及修复
mamolengo · reddit · 2026-09-23
作者在 2× DGX Spark 上用 vLLM 跑 MiMo-V2.6-Flash-RL 作为 agent 后端时发现,社区抱怨的「工具调用不好用」多数是服务端 bug 而非模型问题,共三个可修的问题:
1. 开 thinking + 多轮 + 流式时回复为空
- 症状:agent 报「No response from provider」并重试 4-5 次,服务端日志全是 200 OK。
- 根因:MiMo 的 chat template 把历史 assistant 消息渲染成 <think>{reasoning}</think>{content},vLLM 流式路径用 isreasoningend() 扫 prompt 时提前判定推理已结束,推理内容全部进了 content,剥离 <think> 的客户端把整条回复丢弃。
- 修复:在 chat template 末尾的 generation prompt 里预置 <think>(或关闭 thinking 时预置 <think></think>),用 --chat-template 指定修改后的 jinja。六种场景实测全部通过。
2. 工具循环中模型丢失自己早先的推理
- 双重丢字段:模板只读 message.reasoningcontent,而 vLLM 返回的是 reasoning;vLLM 的 chatutils.py 又只读 reasoning,客户端发 reasoningcontent 会在进模板前被丢掉。可用 /tokenize 端点验证。
- 修复:模板里做字段 fallback;chatutils.py 加一行 fallback(作者用 bind-mount 打补丁文件进容器)。
3. 隐藏的 2,048 token 输出上限(正文被截断,标题已点明存在此问题)
结论:换去 GLM-5.3-Flash 之前,先排查 serving 层,多数「模型问题」其实可修。
「编程与Agent」频道最新
- Cloudflare 推出 Worker Previews:每个 Git 分支獨立运行环境 — dinasaur_404 · 2026-09-23
- Perplexity 用提示引导自蒸馏训练 agent,失败率降至 1.77% — perplexity_ai · 2026-09-23
- Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降 21.2% — perplexity_ai · 2026-09-23
- Tomo 开源 WebMCP Registry:已收录十万站点给 AI Agent 的真实工具 — Jackyhuang · 2026-09-23
- LiteParse 2.8ms 解析一页 PDF,号称全球最快开源解析器再提速 25% — llama_index · 2026-09-23
- UCLA 团队发布 ACLArena:智能体多阶段持续训练的系统性框架 — UCLA-SCAI · 2026-09-23