本地多智能体实测:第二个 Agent 提速 1.5 倍,第四个反而拖后腿
AIForOver50Plus · reddit · 2026-08-20
Reddit 用户在 MacBook Pro M3 Max(128GB 统一内存)上用 4-bit 量化的 Qwen3 27B 密集模型实测多本地 agent 并发的真实收益,把评论区网友的三个预测变成了实验:
- 第二个 agent 有帮助,第四个没有:总吞吐从 1 个 agent 的 16.6 tokens/s 升到 2 个的 20.8,之后趋于平缓甚至下滑;单 agent 解码速度从 17.4 崩到 8 个时的 3.9,首 token 延迟从 0.46s 飙到 32s。总带宽近似固定,加 agent 只是把每个人切得更薄。
- 网友预测精准命中:有人预测 1→2 个 agent 接近 1.5x 而非 2x(解码受内存带宽限制),实测 decode 密集 1.57x、prefill 密集 1.51x。作者自己的 prefill 假设反而没成立,并如实记录了这次失误。
- 长 prompt 更适合并发:prompt 从 170 增至 3100 token,双 agent 收益单调上升(1.52x→1.73x),因为 prefill 是计算密集可并行,decode 不是。
- 密集 27B 是最坏情况:每 token 都要读全部权重;MoE 模型每 token 只激活 3B 参数,同样总线条件下余量更大。
作者称全部实验矩阵已存盘、可复现。
「Infra」频道最新
- 纯 C 引擎 Colibri:消费级硬件跑 2.8T 参数模型 — tom_doerr · 2026-08-20
- 苹果硅质实现 ANE+GPU 联合加速,预填充提速 50% — bakawolf123 · 2026-08-20
- NVIDIA:Vera Rubin 平台每瓦算力提升 10 倍 — nvidia · 2026-08-20
- 观点:SpaceXAI 成第三前沿实验室,算力将达 10GW — thedealdirector · 2026-08-20
- NVIDIA cuOpt 登顶基准测试,开源最强优化问题求解器 — NVIDIAAI · 2026-08-20
- Devin 被指将查询路由至 Opus 5 — teortaxesTex · 2026-08-20