MCP 评测不能只报服务端通过,客户端配置决定结果含义

Sussybaka800869 · reddit · 2026-10-02

一篇关于 MCP 评测方法论的讨论指出:同一个工具在不同客户端里表现差异巨大,加一个说明何时使用它的 skill 又会改变结果,因此「MCP server 通过了」遗漏了实验的一大半。

Reef Infra 的 harness adapter 提供了测试这些差异的组件:adapter 会渲染客户端的配置、规则与 skills,启动无头任务,并读取该客户端的会话格式。Pi、OpenCode、Claude Code、Codex、DeepSeek Harness 和 Hermes 各有独立 adapter。

在同一 adapter 内,可以对比现有 harness 与改动方案在同一批任务上的表现,例如验证某个 skill 是否提升工具类任务的完成率。跨客户端比较则需分别搭建模型、任务、工具访问都匹配的实验,adapter 不会自动让环境等价。

差异是实质性的:Codex 的 Reef Infra 配置在评测中拒绝代码扩展并禁用 hooks、plugins 和 web search;Pi 和 OpenCode 有扩展/插件面;Claude Code 可以渲染插件条目,但激活仍需相关 marketplace 或 settings 引用。盲目复制配置并不代表同一个实验。MCP fixtures 与成功判定仍需自己提供,且客户端配置必须与结果一起保存,因为它决定了测量结果的含义。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →