数万次 Agent 运行实测:开发工具常被提及却几乎不被选中
ycombinator · x · 2026-09-04
Armature 发布了迄今最大规模的「Agent 可发现性」开放实验,覆盖 300 多家公司、20 多个行业,所有运行 trace 公开。核心发现:许多开发工具在 thousands of coding agent runs 中「总被提及、却总不被选中」。
其方法论包括:
- 用仿真实公司结构的合成仓库做统一测试面板,覆盖不同语言与技术栈
- Prompt 以真实 persona 冻结(vibe coder、初级/资深工程师、企业团队)保证可比性
- 使用 Claude Code、Codex 等 pin 定版本的真实 agent CLI,在受控条件下评判结果
此前研究显示,每个模型都有先验偏好,但 prompt、记忆/skills、仓库上下文(语言、文档文件)、公开网络数据等参数都会影响 agent 的工具选择。排行榜区分了开放推荐(greenfield)与部署/仓库约束场景下的选择。该项目同时向开发工具厂商提供定制实验与「被 agent 推荐」的优化服务。
「编程与Agent」频道最新
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- Perplexity API 接入 Stripe Projects,一条 CLI 命令即可开通 — jeff_weinstein · 2026-09-04
- GeoLibre 登陆 CRAN:完整 GIS 嵌入 RStudio、Quarto 与 Shiny — giswqs · 2026-09-04
- Stripe Link agent 钱包上线官方文档,让 AI agent 替用户付款 — jeff_weinstein · 2026-09-04
- Codex 与 Claude 上线推理档位热切换,不破坏提示缓存 — altryne · 2026-09-04
- 长期向量记忆「语义腐烂」怎么治:supersedes 元数据加每周去重 — PennyLawrence946 · 2026-09-04