Cursor多智能体重建SQLite,模型组合致成本差15倍

Cursor 团队进行了一项长程编码测试,让一组多智能体仅根据 835 页的 SQLite 手册(不提供可执行参考代码),成功用 Rust 重建了 SQLite,且重建后的代码通过了 100% 的保留测试集。该实验不仅验证了智能体处理复杂工程任务的可行性,更揭示了模型组合对成本的巨大影响。

关键细节与成本差异

该实验的核心结论是:在复杂 agent 任务中,让前沿模型负责规划、编排和关键决策,再让更便宜的模型负责大部分执行,能显著降低总成本。据 @ZainHasan6 分享的数据,不同模型组合的总成本差异极大:使用 Opus 4.8 + Composer 2.5 的成本为 1,339 美元,Grok 4.5 为 1,928 美元;而不同方案之间的最高成本差异高达 20,057 美元,整体成本跨度可达 15 倍。

蜂群架构与测试设计

据 @AI寒武纪 转述,Cursor 团队将这种多模型 Agent 系统称为“智能体蜂群”架构,其设计核心是让强模型(如 GPT-5.5)作为规划器负责任务分解与决策,弱模型(如 Composer 2.5)作为 worker 负责执行,从而大幅优化成本。此外,@HamelHusain 指出该测试的关键不仅在于模型能力,更在于展示了如何通过优秀的测试集设计和对留出评测的控制,将 AI 代理的效能发挥到极致。

2026-07-21 ~ 2026-07-22 · 8 条相关

一手来源

另有 1 条近重复转述:Sam_Witteveen