一个会在限流前暂停 agent 的调度器
Maleficent_Pain2722 · reddit · 2026-07-20
Reddit 上有人开源了 agentpause,一个用于长时间运行 LLM agent 的调度器,目标是在撞上 rate limit 之前优雅暂停,并在下次运行时从精确步骤继续。
它的做法是:
- 每次调用 LLM 前,先用剩余 rate-limit 预算和安全余量估算下一步成本。
- 如果预算不够,就只等待真正需要的时间,或者先 checkpoint 再退出。
- 下次启动时从同一位置恢复,而不是把整个任务重跑一遍。
作者还区分了“逻辑上的 warm start”和“真正的 warm start”:
- 云端 API 通常只能重发完整上下文,或依赖 provider 侧 prompt caching。
- 在 llama.cpp 里,checkpoint 还能带上 KV-cache,通过 /slots save/restore 直接跳过重新 prefill。
- 以 M1 Pro 为例,恢复约 9k token 的 Qwen3-8B 上下文,冷恢复要 46.9 秒,而 warm restore 只要 0.5 秒,快了约 93 倍。
此外,作者还测到:
- 为了保留历史去做压缩,有时反而会破坏 prefix cache,得不偿失。
- 盲目截断会明显伤害事实召回,还可能诱发模型编造细节。
- 仓库里附带 benchmark,支持多种 provider,也能很容易接入 LangGraph。
所属事件:开源调度器agentpause可在限流前暂停智能体(2 条相关)→
「编程与Agent」频道最新
- 一个 MCP 服务器把 AI agent 每次工具调用都签进可验证 Merkle 链 — Funky_Chicken_22 · 2026-07-22
- Claude Code 团队访谈逐字稿已整理公开 — trq212 · 2026-07-22
- 10 条 Markdown 规则把 Claude Code 改成 ADHD 友好输出 — alex_verem · 2026-07-22
- BUZZ 发布开源群聊平台,主打人机团队协作 — Scobleizer · 2026-07-22
- 一个基于 Firecracker 的平台称可在 256 GB 服务器上跑 6000 个 AI agent — maritime_sh · 2026-07-22
- 智能体自治别急着放权,先跑波次找摩擦点 — JnBrymn · 2026-07-22