一个会在限流前暂停 agent 的调度器
Maleficent_Pain2722 · reddit · 2026-07-20
Reddit 上有人开源了 agentpause,一个用于长时间运行 LLM agent 的调度器,目标是在撞上 rate limit 之前优雅暂停,并在下次运行时从精确步骤继续。
它的做法是:
- 每次调用 LLM 前,先用剩余 rate-limit 预算和安全余量估算下一步成本。
- 如果预算不够,就只等待真正需要的时间,或者先 checkpoint 再退出。
- 下次启动时从同一位置恢复,而不是把整个任务重跑一遍。
作者还区分了“逻辑上的 warm start”和“真正的 warm start”:
- 云端 API 通常只能重发完整上下文,或依赖 provider 侧 prompt caching。
- 在 llama.cpp 里,checkpoint 还能带上 KV-cache,通过 /slots save/restore 直接跳过重新 prefill。
- 以 M1 Pro 为例,恢复约 9k token 的 Qwen3-8B 上下文,冷恢复要 46.9 秒,而 warm restore 只要 0.5 秒,快了约 93 倍。
此外,作者还测到:
- 为了保留历史去做压缩,有时反而会破坏 prefix cache,得不偿失。
- 盲目截断会明显伤害事实召回,还可能诱发模型编造细节。
- 仓库里附带 benchmark,支持多种 provider,也能很容易接入 LangGraph。
所属事件:开源调度器agentpause可在限流前暂停智能体(2 条相关)→
「编程与Agent」频道最新
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27