国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光

Teknium · x · 2026-07-31

GMI Cloud 使用 tinyMMLU 数据集,对比了 Kimi K3、GLM 5.2 和 DeepSeek V4 Pro 在 Hermes Agent 和 OpenCode 两个框架下的表现。

测试表明,不同模型与 Agent 框架的搭配在速度、Token 效率和准确率上差异显著。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →