开源 Agent 实测:云规划+本地执行省 7 倍输出 token,但缓存命中率暴跌
GapNew4766 · reddit · 2026-09-29
Atomic Agent(MIT 开源)团队为 orchestrator/worker 模式做了一次单任务三配置实测,并公开完整数据与架构细节:
实验设置
任务:一页五个 Canvas 手写 3D 投影物理场景,固定镜头,每场景 8 秒,同一行提示词,每次只跑一轮自主运行。云模型为 Sonnet 5.5(OpenRouter),本地模型为单张 RTX 3090 上的 Qwen 3.8 27B Q4。
| 配置 | 完成度 | 耗时 | 云端费用 |
|---|---|---|---|
| Sonnet 5.5 单独 | 4/5 | 9 分钟 | $1.83 |
| Sonnet 规划 + Qwen 写码 | 2/5 | 85 分钟 | $0.67 |
| Qwen 单独 | 1/5 | 26 分钟 | $0 |
架构要点
- 规划器整轮只读:写入在工具结果层拒绝而非移除工具,避免改变工具列表导致 prompt 前缀变化、丢掉 KV cache。
- 委派是契约:每个任务声明提供/依赖什么,任务间命名不匹配会在 worker 启动前被拒绝;任务按依赖分波执行。
- Worker 是无记忆的一次性会话,只拿简报+原始请求引述。
- 完成前验证:规划器用无头浏览器在一次性副本里跑结果并检查 console。
关键结论
- 省钱几乎全靠输出 token:规划器写简报不写码,输出 token 少 7 倍,成本降 2.7 倍。
- 缓存命中率是隐藏代价:纯云配置 92.5% 输入走缓存,而等待慢速本地 worker 的规划器只有约三分之一,省输出却在输入上还回去一部分。
- 本地 worker 是瓶颈:85 分钟 vs 9 分钟,质量也更差。
- 「验证通过」不等于正确:三种配置都通过了无头检查、console 干净,但仍有场景视觉上是坏的(空心方块、永不破碎的墙),崩溃检查抓不住错误的物理。
作者注明每配置只跑了一次,属田野报告,并征集超出「console 无报错」之外的视觉/物理正确性自动验证方案。仓库:github.com/AtomicBot-ai/atomic-agent
所属事件:开源 Agent 架构实测:云规划加本地执行降本但更耗时(2 条相关)→
「编程与Agent」频道最新
- MacAMP 作者:音频播放器每段管道都缺不得,vibecoding 堆不出好架构 — HankYeomans · 2026-09-29
- 周末 vibecode:DeepSeek 规划器驱动的实时版《Among Us》 — ai · 2026-09-29
- MacAMP 作者晒架构图:为什么音频播放器没法纯 vibecode 出来 — HankYeomans · 2026-09-29
- 用 Claude 插件全自动剪辑视频并多平台分发,首支成片上线 — Scobleizer · 2026-09-29
- Swares 代理市场自称成交额破 5000 万美元,上架产品超 6000 个 — KyeGomezB · 2026-09-29
- 实测:Sonnet 5.5 调高推理力度档位,15 项编码测试通过数纹丝不动 — every · 2026-09-29