多模型编程Agent实测:廉价模型败于知识陈旧

一位开发者创建了 MCP 服务器,让 Claude Code 能够将任务委派给 GPT-5.6、DeepSeek、GLM 和本地 Qwen 等模型,并进行了 198 次隐藏测试。重新设计的基准测试表明,廉价模型在多模型编程 Agent 任务中表现不佳,主要原因并非推理能力不足,而是其知识库过于陈旧。

2026-07-21 ~ 2026-07-22 · 2 条相关