Devin Fusion 登上编码智能体榜:61.7 分仅差 Claude Code 4%,成本省 36%
ArtificialAnlys · x · 2026-09-12
Artificial Analysis 在 Devin Fusion 发布当日对其独立评测,这是多模型编码智能体首次进入其 Coding Agent Index(v1.5)。
- Fusion CLI 配置:Claude Fable 5.1(xhigh)+ SWE-2(medium)得 61.7 分,与 Claude Code 中 Claude Fable 5.1(max+fallback)的 62.2 几乎持平。
- 成本:Fusion 每任务 $7.9,比 Claude Code 的 $12.4 便宜 36%;速度基本持平(35.8 vs 34.8 分钟)。
- 分项:DeepSWE 1.1 得 63.1(对比 64.3)、SWE-Atlas QnA 65.9(64.8)、Terminal-Bench 4.0 得 56.1(57.6)。
- 两种测试配置下,Fusion 均处于「分数 vs 每任务成本」的帕累托前沿上。
Fusion 的思路是用前沿主模型搭配高性价比副模型,在保留前沿性能的同时降低成本。
「编程与Agent」频道最新
- Anthropic 团队用 Claude 值班:告警触发即定位根因并提修复 — ClaudeDevs · 2026-09-12
- 用 Codex 直播 AI 全天玩 Minecraft,目标是自主建自动养鸡场 — nickbaumann_ · 2026-09-12
- 与 AI Agent 共事为何更累:委托不减反增心智负担 — bendee983 · 2026-09-12
- 用户称 Codex 已成 Linux 系统管理主界面:「Codex, 修好它」 — mark_k · 2026-09-12
- Alchemy 推出 distilled 项目:把各大 SaaS 文档蒸馏成统一 SDK 供 Agent 调用 — samgoodwin89 · 2026-09-12
- 1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨 — echen · 2026-09-12