DeepSeek V4 Flash 登上 GBench,同价位表现领先且单轮推理更强
teortaxesTex · x · 2026-08-04
DeepSeek V4 Flash 的 GBench 结果已经上线,作者称它是同价位里最强的模型之一。
- 在 agentic coding harness 里,它和 preview checkpoint 表现接近。
- 但在 one-shot 和 fluid intelligence 上明显更强。
- 评测方还说,它的编码能力大致介于 GLM 5.1 和 GLM 5.2 之间,而这两者参数规模都更大。
- GBench 用的是偏游戏化、尽量抗污染的 coding 评测,因此结果可能和常见榜单不完全一致。
「编程与Agent」频道最新
- Taskmarket 让 AI agent 竞标任务,按采纳结果付费 — kleffew94 · 2026-08-04
- Claude.md 新增快捷键、UI 文案和注释规范 — charlieholtz · 2026-08-04
- Claude Code 2.1.221 即将发布 — ClaudeCodeLog · 2026-08-04
- 交易系统的 fail-closed 授权层开源了,想找高风险 Agent 试点 — Riskaval · 2026-08-04
- 面向 Agent 的 trie 记忆系统,用 20% 预算却总是检索过量 — No_Sky9786 · 2026-08-04
- Pi School 推出免费课程,系统讲解最小 agent 框架 Pi — craigsdennis · 2026-08-04