一手实测:DeepSeek V4.1 Flash 在两个 agent 任务上击败 Haiku 5.5

dergachoff · reddit · 2026-10-08

作者在自己的应用里用两个真实 agent 任务对比 Haiku 5.5 与 DeepSeek V4.1 Flash,结果 DeepSeek 全胜。

任务1:调研子 agent(4 个真实 brief,工具为 Exa/Brave 搜索 + 网页抓取 + 图像搜索):

任务2:聊天标题生成(52 条消息,关闭推理):DeepSeek 28 胜,Haiku 8 胜。速度相同(1.1s),Haiku 略便宜。Haiku 常见问题是把回答的第一句当标题,甚至一条 prompt injection 测试消息直接成了标题。

判定方法:Opus 盲评 A/B 双序,双序不一致算平局;作者承认 Claude 评 Claude 有同厂偏差,但 Opus 仍选了 DeepSeek。单次运行的小样本,仅代表作者自己的任务场景。

所属事件:开发者实测:DeepSeek V4.1 Flash 在 agent 任务中击败 Haiku 5.5(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →