DeLM 更新版实测:多智能体快 2.49 倍但评测口径各异
jyangballin · x · 2026-10-08
作者点评 DeLM 团队更新版论文:去中心化协调的多智能体系统(MAS)通过共享上下文和任务队列并行协作,无主 agent,智能体互相共享发现、复用中间结果并纠错,评测从 SWE-bench 扩展到 Terminal-Bench 4.0、DeepSWE v1.1 和 ProgramBench。
有意思的是各家方案在 ProgramBench 上选择的不同展示维度:
- Opus 模型卡:准确率 vs tokens
- DeLM:准确率 vs 墙钟时间(快 2.49 倍但总成本更高)
- Agensh:固定时间下准确率 vs agent 数量
作者类比早期 SWE-bench harness(Devin、SWE-agent、Agentless、AutoCodeRover、OpenHands)各按不同轴展示优势的历史,指出多智能体评测同样面临口径碎片化问题——加更多 agent 是否真的更高效,答案常常是否定的。
「编程与Agent」频道最新
- Victor Taelin 修复 AI 编码 harness 缓存 bug,缓存命中率达 98% — carsonfarmer · 2026-10-08
- 开发者观察:大家都在卖数据,却没人想到卖 Claude Skills — tedddyoweh · 2026-10-08
- Claude Code v2.1.294 修复 prompt/agent hooks 拦不住该拦命令的问题 — ashwin-ant · 2026-10-08
- 开发者打造 AI Agent 运行时授权层,招募真实团队沙盒测试 — Invisible_act1988 · 2026-10-08
- 开发者用 Codex 写 CAD 与构建文档,实体机器人硬件搭建效率起飞 — OpenAIDevs · 2026-10-08
- cogmemai-mcp 上线:28个MCP工具为AI编码助手提供跨会话云记忆 — modelcontextprotocol · 2026-10-08