数万次 Agent 运行实测:开发工具常被提及却几乎不被选中

ycombinator · x · 2026-09-04

Armature 发布了迄今最大规模的「Agent 可发现性」开放实验,覆盖 300 多家公司、20 多个行业,所有运行 trace 公开。核心发现:许多开发工具在 thousands of coding agent runs 中「总被提及、却总不被选中」。

其方法论包括:

此前研究显示,每个模型都有先验偏好,但 prompt、记忆/skills、仓库上下文(语言、文档文件)、公开网络数据等参数都会影响 agent 的工具选择。排行榜区分了开放推荐(greenfield)与部署/仓库约束场景下的选择。该项目同时向开发工具厂商提供定制实验与「被 agent 推荐」的优化服务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →