一手实测:DeepSeek V4.1 Flash 在两个 agent 任务上击败 Haiku 5.5
dergachoff · reddit · 2026-10-08
作者在自己的应用里用两个真实 agent 任务对比 Haiku 5.5 与 DeepSeek V4.1 Flash,结果 DeepSeek 全胜。
任务1:调研子 agent(4 个真实 brief,工具为 Exa/Brave 搜索 + 网页抓取 + 图像搜索):
- Haiku low:1胜3负,480s,$0.09;medium:1/1/2;high:0/1/3,992s,$0.31
- DeepSeek low:3胜1负,721s,$0.35
- Haiku 更快、成本约 1/4,但有两个 brief 始终输:DeepSeek 找到了品牌官方规范页(含精确 HEX/Pantone 色值),Haiku 即使 high 档 60 次工具调用也没找到,只能从截图猜色。提升推理档位只让它搜得更多,不搜得更好。
- Haiku 唯一赢的 brief 是找论坛引语——只靠 Exa 摘要、从不打开页面,引用来源可信度存疑。
任务2:聊天标题生成(52 条消息,关闭推理):DeepSeek 28 胜,Haiku 8 胜。速度相同(1.1s),Haiku 略便宜。Haiku 常见问题是把回答的第一句当标题,甚至一条 prompt injection 测试消息直接成了标题。
判定方法:Opus 盲评 A/B 双序,双序不一致算平局;作者承认 Claude 评 Claude 有同厂偏差,但 Opus 仍选了 DeepSeek。单次运行的小样本,仅代表作者自己的任务场景。
所属事件:开发者实测:DeepSeek V4.1 Flash 在 agent 任务中击败 Haiku 5.5(2 条相关)→
「编程与Agent」频道最新
- 用户吐槽 6x-Sol 质量差、Astra 半天烧完 $200 额度,转投 Claude Code — Late_Change5029 · 2026-10-08
- 一人公司用一个 Obsidian 库跑全部业务,AI 承担大半负担 — dSebastien · 2026-10-08
- 独立开发者 3 周实测:双 agent 驱动+审查工作流踩坑复盘 — Moist_Tonight_3997 · 2026-10-08
- Cognizant 拟招 1500 美国毕业生,用 Devin 助货运公司降本 37% — shashib · 2026-10-08
- Cisco 将 Claude Managed Agents 引入 Webex,并自建治理层 — shashib · 2026-10-08
- 开发者实测 6.1 Sol:设计 iOS 原生应用界面相当惊艳 — Dimillian · 2026-10-08