Opus 5.5 系统卡显示:多智能体更快达成相同结果,仅用 166/200 任务
jyangballin · x · 2026-09-23
Anthropic 发布的 Opus 5.5 系统卡中包含 ProgramBench 上的多智能体实验:多智能体系统与单智能体最终达到相同的结果,但速度更快。
作者(jyangballin)指出一个细节:实验只使用了 200 个任务中的 166 个,他强烈建议使用全部 200 个任务,因为长尾中的困难任务才真正难以通过,现有子集可能低估了难度。
所属事件:Opus 5.5 系统卡披露多智能体系统 scaling law 实验(5 条相关)→
「编程与Agent」频道最新
- Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降 21.2% — perplexity_ai · 2026-09-23
- Tomo 开源 WebMCP Registry:已收录十万站点给 AI Agent 的真实工具 — Jackyhuang · 2026-09-23
- LiteParse 2.8ms 解析一页 PDF,号称全球最快开源解析器再提速 25% — llama_index · 2026-09-23
- UCLA 团队发布 ACLArena:智能体多阶段持续训练的系统性框架 — UCLA-SCAI · 2026-09-23
- 警惕 jev 的 slop 用法:决策环节换弱模型,你根本察觉不到丢失的能力 — generativist · 2026-09-23
- Coinbase 开放 Agent 交易:6000 只美股+x402 微支付买实时行情 — MurrLincoln · 2026-09-23