MCP 评测不能只报服务端通过,客户端配置决定结果含义
Sussybaka800869 · reddit · 2026-10-02
一篇关于 MCP 评测方法论的讨论指出:同一个工具在不同客户端里表现差异巨大,加一个说明何时使用它的 skill 又会改变结果,因此「MCP server 通过了」遗漏了实验的一大半。
Reef Infra 的 harness adapter 提供了测试这些差异的组件:adapter 会渲染客户端的配置、规则与 skills,启动无头任务,并读取该客户端的会话格式。Pi、OpenCode、Claude Code、Codex、DeepSeek Harness 和 Hermes 各有独立 adapter。
在同一 adapter 内,可以对比现有 harness 与改动方案在同一批任务上的表现,例如验证某个 skill 是否提升工具类任务的完成率。跨客户端比较则需分别搭建模型、任务、工具访问都匹配的实验,adapter 不会自动让环境等价。
差异是实质性的:Codex 的 Reef Infra 配置在评测中拒绝代码扩展并禁用 hooks、plugins 和 web search;Pi 和 OpenCode 有扩展/插件面;Claude Code 可以渲染插件条目,但激活仍需相关 marketplace 或 settings 引用。盲目复制配置并不代表同一个实验。MCP fixtures 与成功判定仍需自己提供,且客户端配置必须与结果一起保存,因为它决定了测量结果的含义。
「编程与Agent」频道最新
- 哥飞上线 SEO Agent:一句话自动查关键词难度并给出执行建议 — gefei55 · 2026-10-02
- 语音 Agent 实测:提前查订单,别急着执行取消 — HaktanSuren · 2026-10-02
- 有人开了一个自主运行的 X 账号,让 AI 独立向 AI 领域发问 — irinarish · 2026-10-02
- 用户实测 GPT-6.1 自动整理数十笔 AI 订阅账单,仅耗 2% 额度 — EXM7777 · 2026-10-02
- Python 技巧:用 xmltodict 像 JSON 一样解析 XML — KhuyenTran16 · 2026-10-02
- 设计师做「AI 模型塔罗牌」网站,Codex agent 自动收录新模型 — ColleenMBrady · 2026-10-02