多模型编程 Agent 实测:廉价模型败在知识陈旧而非推理
MeetStraight1899 · reddit · 2026-07-22
一位开发者基于社区反馈,重新设计了针对多模型编程 Agent 的基准测试。测试通过 MCP 服务器让 Claude Code 调度 GPT-5.6、DS4、GLM 及本地 Qwen 等模型,核心发现如下:
- 知识截断陷阱:在要求使用最新版依赖库(如 zod v4)的测试中,廉价模型(DS4 Pro、GLM、Qwen 等)全部阵亡,因为它们基于过时的训练数据生成了无法运行的旧 API 代码。但在纯逻辑推理测试中,这些模型表现近乎完美。
- 一致性不等于正确性:这些因知识陈旧导致的错误在多次重试中表现出了极高的一致性,这意味着简单的重试机制无法修复此类系统性错误。
- 完美表现梯队:Claude Sonnet 5、Opus 4.8、GPT-5.6 以及 Grok 4.5 成功通过了知识截断陷阱。尤其是 Grok 4.5,即使没有文件访问权限也能准确知晓最新 API。
- 成本与算力:Agent 工作流的 Token 消耗大约是普通聊天的 20 倍,高昂的成本主要靠订阅和缓存机制来缓解。
所属事件:多模型编程Agent实测:廉价模型败于知识陈旧(2 条相关)→
「编程与Agent」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11