推理服务可能要按 tool call 超时调整缓存策略
lucasmeijer · x · 2026-07-26
帖子在问一个很具体的基础设施问题:推理服务商在决定“会把一段对话缓存多久”时,是否应该把 tool call 的超时设置 也考虑进去。
作者认为,统一写死成“永远 5 分钟”大概率不是最优解,因为不同工作流里,工具调用的行为和超时预期可能差异很大。这是一个很典型但实用的推理栈/会话缓存策略问题。
「Infra」频道最新
- 基础设施团队正把 MCP 接入 AI agent 做运维 copilot — BestRequirement7539 · 2026-07-26
- OnePlus 12 本地跑图像模型,320×320 仍要几分钟 — sgcego · 2026-07-26
- 创始人揭秘停止融资内幕:算力瓶颈比资金更致命 — bookwormengr · 2026-07-26
- RTK 用 Rust 压缩 AI Agent 的 Shell 输出,最高省 90% — OpenAIDevs · 2026-07-26
- OpenSmith 更新本地 LLM 追踪与可观测面板 — Maleficent-Emu-4549 · 2026-07-26
- 2007 年集合通信综述,至今仍适合入门 NCCL — abhi9u · 2026-07-26