实测双本地 Agent 并发:Batching 真实存在但有代价

AIForOver50Plus · reddit · 2026-08-18

作者在 M3 Max MacBook 上使用 Qwen 3.8 27B 4bit 模型,实测两个本地 Agent 同时请求同一模型时的运行机制。通过编写精确同步的负载驱动脚本,发现服务器确实实现了持续批处理,两个 Agent 可共享模型。然而并发并非免费:增加 Agent 会提升总吞吐量,但单个请求延迟增加且启动等待变长。测试显示 4 个 Agent 是当前设备的最佳甜点,超过则无益。此外,固定随机种子会导致所有请求串行化。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →