同一个 MCP 问题从 43.7 万 token 降到 7.8 万,实测揭示成本来自轮次而非负载
loookashow · reddit · 2026-09-08
作者分享对 MCP 服务器做 agent 实测的工程复盘,认为符合性测试(conformance testing)几乎没价值,真实 agent 一周就找出五个问题。
- 成本由往返轮次决定,不是负载大小:托管 connector 每次服务端工具循环都重发全部对话,一次工具调用的真实成本 = 返回内容 × 其后剩余轮次。18 个场景(自然语言问题 + 检查 trace 而非答案文本:调了哪些工具、顺序、返回、token 数)在 Anthropic 托管 connector 和 OpenAI Responses API 的托管 MCP 上跑,同一问题从 437k 输入 token 降到 78k,仅靠减少单次返回和调用次数。
- pauseturn 陷阱:Anthropic connector 每请求上限 10 次工具迭代,触顶返回 stopreason: "pauseturn",HTTP 200 无错误字段。客户端若只认 endturn 会把截断答案记为成功。
- JSON-RPC notification 以缺失 id 定义,而非方法名:带 id 的 notifications/initialized 是必须响应的请求,客户端静默是错的。
- 测试设计教训:"无工具错误"检查误杀三个完全正常的场景——agent 猜集合标识符、收到带恢复提示的错误、自行恢复并答对。面向探索型界面的检查应允许探索。
- 页大小默认 5、上限 100,并把两个数值写进工具 JSON schema 让模型自己选。
「编程与Agent」频道最新
- 用小模型替代正则做语法高亮,正确率对标 Shiki — shuding · 2026-09-08
- gpu-lexer 作者补充:训练覆盖 50+ 语言,模型本体约占库体积 70% — shuding · 2026-09-08
- gpu-lexer 性能细节:WebGPU 加速、不阻塞主线程,但尚不能替代现有高亮器 — shuding · 2026-09-08
- Vercel 实验项目 gpu-lexer:27.5KB 小模型借 WebGPU 在浏览器做语法高亮 — shuding · 2026-09-08
- 想清理 Claude 留下的工作树,一看仓库里竟有 129 个 — alec_helbling · 2026-09-08
- Deemos 推出 Hyper3D MCP,在 Codex 里用提示词直接生成 3D 模型 — sidahuj · 2026-09-08