On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces
Ahmed Hereiz, Yingzhe Lyu, Hao Li, Bram Adams, Ahmed E. Hassan
cs.SE, cs.AI
2026-08-29
Queen's 扫了 1926 个仓库和 8351 个 Claude Code 插件。半年提交涨 8.8 倍,feat 占 39.6% 已超传统开源一倍有余,Claude 挂名 34.9%,skill 内脚本与说明书有 78% 功能耦合。
Claude Code 从 2025 年 10 月起支持插件市场:开发者把 skill、slash command、agent、hook、MCP 配成可安装包,别人注册市场后就能复用整套工作流。这些包的主体不是编译产物,是给模型运行时读的 Markdown 指令,再配上脚本和 JSON。
传统软件工程研究过 npm、GitHub Actions、GPT Store,也研究过 skills.sh 上的 skill 文件。没人回答过更基础的问题:这些插件是持续维护的软件,还是写完就扔的一次性提示词?多组件插件改了一处,另一处会不会悄悄过期?Queen's University 的 SAIL 实验室扫了 GitHub 上全部带 .claude-plugin/marketplace.json 的公开仓,给了第一份基线。
2026 年 4 月 2 日用 GitHub Code Search 搜 manifest,原始命中 11254 条,去重后 10646 个仓库。81.7% 星标不到 10,其中 46.3% 是 0 星,所以门槛定在 ≥10 星,留下 1926 个仓库、2018 个市场、8351 个能在本地解析的插件,以及 77773 次碰到插件文件的提交(3948 个作者,中位 13 次/仓)。5 星和 25 星两档敏感性分析里,skill 主导、feat 主导、组件排序都不变。
三个问题三条流水线:
市场还在加速,没有平台期。插件相关提交从 2025 年 10 月的 2923 次涨到 2026 年 3 月的 25618 次,6 个月 8.8 倍,Sen 斜率大约每月再多 4550 次。84.5% 的仓库是上线后才建的;后三个月新建 1102 个,是前三个月 525 个的 2.1 倍。Skill 实例从 1776 涨到 39287(22 倍),已经超过其余组件之和 20280。软件工程类占 61.3%(代码生成 25.9%、基础设施 16.6%、调试分析 14.8%、版本控制 4.0%),和 skills.sh 的早期用户画像对得上。34.4% 的插件混用两种以上组件;72.1% 的市场只挂一个插件。三个聚合仓独占 12.1% 的插件条目。
提交画像跟传统开源差一截:
| 类型 | 插件仓(重标后) | 传统 OSS(Zeng 等,88704 次) |
| feat | 39.6% | 17.2% |
| fix | 25.8% | 27.0% |
| chore | 21.0% | 26.0% |
| docs | 1.7% | 8.1% |
feat、fix、chore 合占 86.5%。原始 docs 标签有 10.3%,重标后掉到 1.7%:8007 条 docs 里只剩 16% 是给人看的 README,其余改到 feat(3047)、fix(3353)、chore(279)。人工样本里 74% 的 docs 提交改的是模型运行时读的指令。build 占 1.1%、test 占 0.5%,自然语言工件几乎不需要编译和测试套件。
Claude 以 trailer、邮箱、作者名挂名 27159 次,占 34.9%;所有 coding agent 合计 35.5%,其余工具加起来不到 0.5%。perf 提交 Claude 挂名最高(40.1%),revert 最低(16.2%)。这是下界:很多人用完 agent 自己提交,不写 Co-Authored-By。
组件之间,只有 agents 与 commands 的 Lift 到 1.40,超过随机;skill 跟谁一起改的 Confidence 都在 43%57%,但 Lift 全在 0.590.78,那是 skill 太常见,不是专属耦合。真正新的依赖在 skill 目录内部:.py/.sh 和配套 Markdown 的 Lift 是 1.371.58。64 个同改 PR 里 78% 功能耦合,接口变更和内部逻辑各占耦合样本的 34%。有一次改模型标识符,24 个 SKILL.md 一起跟上。
做 agent 插件的人可以把 AI 读的 Markdown 当源代码管。过期的 SKILL.md 会让模型用已经删掉的 flag 调脚本,没有编译器报这个错。改 skill 目录里的脚本,同一 PR 里检查说明书。
别拿传统 CCS 分类器直接打这类仓库。docs、perf、style、refactor 四个标签在这里语义已经漂了:docs 多半在改运行时行为,perf 盯的是模型档位和 prompt 长度,不是算法复杂度。
Claude 挂名 34.9% 是能观测到的人机分工痕迹,适合做纵向观察,检测法只抓得到显式署名。对生态计数要打折:38.7% 的归一化插件名出现不止一次,多半是聚合仓重复登记。SE 占 61.3% 更像早期开发者画像,还没证据说会一直这样。
只覆盖 GitHub 公开仓,私有和已删的进不来。10 星门槛砍掉了大量噪声,5/25 星下定性结论稳住了,小仓行为仍未知。采集时仓库中位年龄只有 80 天,6 个月 8.8 倍这条增长曲线随时可能拐。结论只对 Claude Code 插件成立,Cursor、Copilot、Gemini 有没有同样的标签漂移,论文没测。Qwen 和 GPT-5-mini 的分类都是单次运行;人工编码 κ 分别是 0.671(提交)和 0.74(PR),边界 case 仍靠读 diff 猜意图。agent 检测是下界。提交只要碰到插件文件就算数,test 样本里 48% 是顺便改到的,真正的插件维护负担可能比 77773 这个数字看起来更集中。