100 个 agent 并行审文档:5 分钟 5.75 美元的压测实录
Pitiful-Surround-285 · reddit · 2026-09-25
一个开源 coding agent harness 的压测:用一句 prompt 要求至少 100 个 agent 更新自己的发布文档。编排器 GPT-6 Astra 把 24 页文档拆成 100 个审阅任务(每页 4 个角度:与 Rust 源码比对、发布变更、示例与 flag 核对、链接与限制),100 个 GPT-6 Luna 审阅者并行只读不改,25 个 GPT-6 Sol 编辑各管一个文件避免冲突,最后再加 2 个 Sol 做终检。
结果与成本
- 全部 100 个 agent 均返回报告,最慢者 2 分钟出头;fan-out 耗时 4m55s,prompt 到提交不到 10 分钟,改动 29 个文件(+276/-90)
- 经 OpenRouter 计费约 5.75 美元(Astra $2.94、Sol $2.08、100 个 Luna 共 $0.73,单个审阅者不到 1 美分);三模型也可走 ChatGPT 订阅零额外成本
- 确实抓出真实问题:SDK 错误示例编译不过、虚构的 subagent 深度限制 5、provider 页漏了 3 家、MCP timeout 前后矛盾、TypeScript REPL 在新版 bun 上损坏
控制成本的设计
- 审阅者限一页一角度、最多 6 轮查看 4 条发现,回复编排器少于 100 词,终检后 Astra 上下文仅用 7%(75K/1.05M)
- 模型白名单强制执行,worker 调用非白名单模型直接拒绝,防止 planner 偷偷用大模型
- worker 默认上限 24 步或 5 分钟,卡死自动结束;全部运行在一个 6.5 MB 的 Rust 二进制里
所属事件:开源编码 agent harness 实测百个智能体并行审文档(2 条相关)→
「编程与Agent」频道最新
- Antithesis 用变异测试教 Agent 主动破坏分布式系统 — moarbugs · 2026-09-25
- LlamaParse 解析美联储点阵图,九个数字零误差 — llama_index · 2026-09-25
- 微软重构 Copilot 为超级应用,Autopilot 常驻 agent 跨接 MCP — rohanpaul_ai · 2026-09-25
- 实测证明 RAG 分不清反义句,好模型不可替代 — galratner · 2026-09-25
- AI Engineer Paris 演讲:用 /pr 与 /retro 让 PR 审得更快 — mattpocockuk · 2026-09-25
- T-REX:用 LLM 智能体编排去 novo 蛋白质结合剂设计的开源控制器 — ArashVahdat · 2026-09-25