国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光
Teknium · x · 2026-07-31
GMI Cloud 使用 tinyMMLU 数据集,对比了 Kimi K3、GLM 5.2 和 DeepSeek V4 Pro 在 Hermes Agent 和 OpenCode 两个框架下的表现。
- Kimi K3:在 Hermes 下仅需 40 秒、11万 token 即拿到 96 分,OpenCode 耗时较长得 93 分。
- GLM 5.2:两个框架均得 94 分,但 Hermes 的 token 消耗远低于 OpenCode。
- DeepSeek V4 Pro:Hermes 拿到 97 分最高分,但 OpenCode 耗时更短且成本极低(0.06 美元)。
测试表明,不同模型与 Agent 框架的搭配在速度、Token 效率和准确率上差异显著。
「编程与Agent」频道最新
- MCP协议迎破坏性更新:无状态化安全迁移指南 — lee_stott · 2026-07-31
- LangChain 创始人推荐构建 Agent 应用的生态工具栈 — hwchase17 · 2026-07-31
- Chip Huyen 演示 1409 个 Agent 协同工作流 — hugobowne · 2026-07-31
- Agent给老板发了假链接:开发者反思RAG最佳实践 — gogeta7124 · 2026-07-31
- 实测 DeepSeek-V4-Flash 智能体:3D 任务成本仅 0.07 美元 — cedric_chee · 2026-07-31
- Chamath 预言:AI 代理代码将降低软件错误率与安全事件 — iamKierraD · 2026-07-31