DeLM 更新版实测:多智能体快 2.49 倍但评测口径各异

jyangballin · x · 2026-10-08

作者点评 DeLM 团队更新版论文:去中心化协调的多智能体系统(MAS)通过共享上下文和任务队列并行协作,无主 agent,智能体互相共享发现、复用中间结果并纠错,评测从 SWE-bench 扩展到 Terminal-Bench 4.0、DeepSWE v1.1 和 ProgramBench。

有意思的是各家方案在 ProgramBench 上选择的不同展示维度:

作者类比早期 SWE-bench harness(Devin、SWE-agent、Agentless、AutoCodeRover、OpenHands)各按不同轴展示优势的历史,指出多智能体评测同样面临口径碎片化问题——加更多 agent 是否真的更高效,答案常常是否定的。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →