Kimi K3 与 DeepSeek V4.1 在 NVIDIA NIM 上频繁超时,其他模型正常
Professional_Log1367 · reddit · 2026-10-09
楼主在 opencode 中通过 NVIDIA NIM 调用 Kimi K3 和 DeepSeek V4.1 Flash 时持续报错("took too long to respond" / 无响应头),而 GLM 5.3、5.3 Flash 等其他模型虽然慢但能正常返回。
他的排查发现:
- 四次 status: 200 的失败产出零 reasoning token、仅一两个 content 项——像是启动后立即中断
- DeepSeek 的 "waiting for response headers" 失败恰好跑了 200 秒,content: [],什么都没生成
- 三个模型都标记 reasoning: true,推理模式不是区分因素
- 失败远早于其设置的 30 分钟超时,也不像 rate limit
帖子向社区求解这些模型在 NIM 上失败而其他模型正常的原因。
「Infra」频道最新
- lithos-metal 内核在 M5 上实测快于 Ollama,作者称深度调优 M5 Max — JiaZhihao · 2026-10-09
- 3000 万参数模型跑在 Postgres 里,召回率媲美 0.6B 嵌入模型 — bdsqlsz · 2026-10-09
- 开发者发现 vLLM 可传入 input embeds,猜想微调 token 被严重低估 — cephaloform · 2026-10-09
- Kevin Kwok 长文:TSMC 如何靠抽象 warfare 造出自己的市场 — kevinakwok · 2026-10-09
- 极客级隐私栈:searxng 藏在 67 层代理链后仅走 tailnet — haydendevs · 2026-10-09
- iPad 外接 AMD R9700 跑 Qwen 27B 达 159 tok/s — TheOriginalG2 · 2026-10-09