自建 Agent 实测:GLM-5.2 综合最佳,DeepSeek Flash 性价比极高

codes_astro · reddit · 2026-08-14

一位开发者使用 Pydantic Agent 框架自建了智能体测试环境,对近期发布的多款开源/开权模型(如 GLM-5.2、Kimi-K3、MiniMax M3、DeepSeek V4 等)进行了真实的编程任务测试。

测试采用“构建→审查→修复”的循环机制,不使用外部裁判模型,主要考察最终可用性、Token 消耗、成本和修复次数。结果显示:

核心结论是:公开 Benchmark 分数无法完全预测模型在真实智能体工作流中的表现,实际产出比跑分更重要。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →