Agentpause:限流前暂停Agent

Maleficent_Pain2722 · reddit · 2026-07-20

作者做了一个叫 **agentpause** 的调度器,专门给长时间运行的 LLM agent 用:在触发 rate limit 之前先暂停,之后再从断点继续,尽量不丢工作进度。 - 每次调用前,它会根据 provider 的 rate-limit headers 和安全余量,估算下一步是否还装得下。 - 如果预算不够,就按真实剩余时间等待,或者做 checkpoint 后干净退出。 - 下次运行时,直接从精确步骤恢复,而不是整任务重跑。 - 对 OpenAI、Anthropic、Groq 这类云 API 来说,这只是“逻辑上的 warm start”:上下文还是要重发,但不会重复做任务。 - 在 **llama.cpp** 上,checkpoint 还能通过 `/slots save/restore` 保存/恢复 **KV cache**,这才是真正的 warm start。 - 作者在 M1 Pro 上测了约 **9k tokens** 的 Qwen3-8B 恢复:冷启动重预填充 **46.9 秒**,warm restore 只要 **0.5 秒**,快约 **93 倍**。 - 另一个实验显示,粗暴截断上下文会严重破坏回忆质量,而一次便宜的摘要调用可以保住全部埋下的事实。 项目是 MIT 许可,依赖很少,既能直连各家 provider,也能通过 LiteLLM 使用,还能两行接入 LangGraph。

所属事件:开源调度器agentpause可在限流前暂停智能体(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →