小型实测:DeepSeek V4.1 Flash 击败 Haiku 5.5,研究子代理与标题双胜

dergachoff · reddit · 2026-10-08

一位 GPU 贫民开发者(M2 Max 32GB)在自己应用的两个小任务上实测 Haiku 5.5 能否替代 DeepSeek V4.1 Flash,结论是替代不了。

任务一:研究子代理(搜网页、读页面、写带来源报告,双方同配 Exa+Brave 搜索工具):

Haiku 更快更便宜(low 档便宜 4 倍),但同样的两个 brief 每次都输:其中一个需要找到品牌官方 guideline 页面的精确 HEX/Pantone 色值,DeepSeek 找到了,Haiku 即使 high 档跑 60 次工具调用也没找到,只能靠截图猜色。Haiku 唯一赢的 brief 是找论坛真实引语——但它只看 Exa 摘要从不开页面,来源可信度存疑。

任务二:聊天标题(52 条消息、关推理):DeepSeek 28 胜、Haiku 8 胜、9 平、7 相同,速度同为 1.1s。Haiku 的问题是常把标题写成回答的第一句,甚至一条 prompt injection 测试消息直接成了标题。

评测方法:Opus 盲评 A/B 双序,双序不一致记平局;作者承认 Claude 评 Claude 有同门偏差,但即便如此仍判 DeepSeek 胜。每组只跑一次,属个人测试非实验室级基准。

所属事件:开发者实测:DeepSeek V4.1 Flash 在 agent 任务中击败 Haiku 5.5(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →