Agentpause:限流前暂停Agent
Maleficent_Pain2722 · reddit · 2026-07-20
作者做了一个叫 agentpause 的调度器,专门给长时间运行的 LLM agent 用:在触发 rate limit 之前先暂停,之后再从断点继续,尽量不丢工作进度。
- 每次调用前,它会根据 provider 的 rate-limit headers 和安全余量,估算下一步是否还装得下。
- 如果预算不够,就按真实剩余时间等待,或者做 checkpoint 后干净退出。
- 下次运行时,直接从精确步骤恢复,而不是整任务重跑。
- 对 OpenAI、Anthropic、Groq 这类云 API 来说,这只是“逻辑上的 warm start”:上下文还是要重发,但不会重复做任务。
- 在 llama.cpp 上,checkpoint 还能通过 /slots save/restore 保存/恢复 KV cache,这才是真正的 warm start。
- 作者在 M1 Pro 上测了约 9k tokens 的 Qwen3-8B 恢复:冷启动重预填充 46.9 秒,warm restore 只要 0.5 秒,快约 93 倍。
- 另一个实验显示,粗暴截断上下文会严重破坏回忆质量,而一次便宜的摘要调用可以保住全部埋下的事实。
项目是 MIT 许可,依赖很少,既能直连各家 provider,也能通过 LiteLLM 使用,还能两行接入 LangGraph。
所属事件:开源调度器agentpause可在限流前暂停智能体(2 条相关)→
「编程与Agent」频道最新
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11