自建 Agent 实测:GLM-5.2 综合最佳,DeepSeek Flash 性价比极高
codes_astro · reddit · 2026-08-14
一位开发者使用 Pydantic Agent 框架自建了智能体测试环境,对近期发布的多款开源/开权模型(如 GLM-5.2、Kimi-K3、MiniMax M3、DeepSeek V4 等)进行了真实的编程任务测试。
测试采用“构建→审查→修复”的循环机制,不使用外部裁判模型,主要考察最终可用性、Token 消耗、成本和修复次数。结果显示:
- GLM-5.2:综合质量最佳,9次运行仅需1次修复,UI和首遍准确率表现优异。
- MiniMax M3:速度与成本的最佳选择,输出可用但 UI 略逊一筹。
- DeepSeek V4 Flash:性价比黑马,成本极低且在代码逻辑和可用性上超越了 V4 Pro。
- Kimi-K3:尽管公开跑分很高,但在该测试框架中表现不佳,需要大量修复。
核心结论是:公开 Benchmark 分数无法完全预测模型在真实智能体工作流中的表现,实际产出比跑分更重要。
「编程与Agent」频道最新
- 上下文窗口不等于记忆:构建 AI 智能体记忆架构指南 — blaizedsouza · 2026-08-14
- 生产级 AI 智能体安全:即时权限提升框架 — blaizedsouza · 2026-08-14
- Agent Arena 智能体榜单:Claude Opus 5 领跑,Kimi K3 进前五 — arena · 2026-08-14
- 开源错误监控智能体:自动关联代码与Slack记录 — tom_doerr · 2026-08-14
- 突破模型部署后的停滞期:持续学习技术正碎片化落地 — bigdata · 2026-08-14
- Arcee 开源内部研发利器 NAC 编码工具 — code_star · 2026-08-14