VC 创始人实测:100 个 Opus 智能体不比 10 个强,扩展性远逊预期
zsakib_ · x · 2026-10-11
Planetary VC 创始人 Ramez Naam 在 Noahpinion 播客中给出多智能体扩展的实测数据,指出智能体规模化是「我们见过的最差的 scaling」:
- 用 Claude Opus 处理问题时,单智能体成功率约 70%;从 1 个加到 4 个智能体只提升 3 个百分点,4 到 16 个再提升 2 个点;超过 10 个智能体后完全不再改善,100 个也无济于事。
- 他认为问题层级的 scaling 效率排序是:预训练 > 测试时算力 > 多智能体协作。峰值单体智能在很多问题上远比大量低水平实体协作更重要,并以「让俄亥俄州哥伦布全市人口一起推导广义相对论也比不过爱因斯坦一人」作比。
- 同一访谈还质疑智能爆炸论:AI 自我改进循环比起飞所需弱 5-10 倍,OpenAI 研究员人均 token 用量增至 124 倍、实验数仅增至 1.6 倍,实验增速远低于算力投入增速。他称实验室公开表态与其内部数据不符。
结论:多智能体堆量与 AI 自我改进循环的回报都远低于行业叙事。
所属事件:投资人实测称多智能体扩展性远逊预期 反驳智能爆炸论(2 条相关)→
「编程与Agent」频道最新
- 评测即回放:用 R2+Docker 沙盒搭 agent eval,90% 功夫在测量 — danshipper · 2026-10-11
- 自动研究 Agent 会陷入「点子盆地」,fork-and-flush 提出破局法 — menhguin · 2026-10-11
- JetBrains Air 插件实测:WebStorm 里并行管理两个编码 Agent — mhdfaran · 2026-10-11
- 用 Opus 5.5 vibe code 复刻《奥日》风格平台游戏,Boss 追逐战惊艳 — chongdashu · 2026-10-11
- 开发者自建日志工具追查 OpenAI 账单:吃掉预算的竟不是 token 大头 — Atm1n9 · 2026-10-11
- Clanker Cloud 支持接入邮箱,可把邮件直接交给 agent 处理 — tekbog · 2026-10-11