DeepSeek V4 Flash 在多应用 agent 基准上赢过 GLM 和 Kimi
LimpComedian1317 · reddit · 2026-08-04
DeepSeek V4 Flash 在复杂 agent 任务上赢过 GLM 5.2 和 Kimi K3
Composio 说他们把 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 放到一套高难度的长流程 agent 测试里,任务跨 PagerDuty、Gmail、HubSpot、Airtable、Slack 等多个应用。
- 评测使用 Pi Agent + Composio MCP 作为统一 harness,尽量保证公平。
- DeepSeek V4 Flash 最快,平均每题 164 秒,比 GLM 快约 2.5 倍,比 Kimi 快约 1.4 倍。
- 平均单题成本约为:DeepSeek $0.08、GLM $0.57、Kimi $1.39。
- 成功率很接近:DeepSeek 20/30,Kimi 21/30,GLM 21/30。
- 更强的前沿模型仍领先:Fable 5 和 GPT-5.6 Sol 都是 24/30,Opus 5 为 23/30。
- 三者风格不同:GLM 更省 token,DeepSeek 更快但更“吃 token”,Kimi 介于两者之间。
原帖也在询问其他人在开放权重模型的 agent 工作流上的实战体验。
「编程与Agent」频道最新
- 智能体上下文优化成生产必修课 — blaizedsouza · 2026-08-04
- Kimi K3 在一场奇怪的 canvas 代码评测中跑到 116 tok/s — MaziyarPanahi · 2026-08-04
- openwiki 新增 .openwikiignore,帮 agent 省 token — BraceSproul · 2026-08-04
- 用 Lovable 五分钟搭建完整 AI 品牌资产工作室 — PrajwalTomar_ · 2026-08-04
- GitHub Stacked PRs 教程把大 PR 拆成可审查分层 — DanWahlin · 2026-08-04
- Cohere 课程讲透 LLM 应用评测、追踪与反馈闭环 — Cohere · 2026-08-04