小型实测:DeepSeek V4.1 Flash 击败 Haiku 5.5,研究子代理与标题双胜
dergachoff · reddit · 2026-10-08
一位 GPU 贫民开发者(M2 Max 32GB)在自己应用的两个小任务上实测 Haiku 5.5 能否替代 DeepSeek V4.1 Flash,结论是替代不了。
任务一:研究子代理(搜网页、读页面、写带来源报告,双方同配 Exa+Brave 搜索工具):
- Haiku low:对 DeepSeek 1胜3负,480s/$0.09
- Haiku medium:1胜1平2负,555s/$0.12
- Haiku high:0胜1平3负,992s/$0.31
- DeepSeek low:721s/$0.35
Haiku 更快更便宜(low 档便宜 4 倍),但同样的两个 brief 每次都输:其中一个需要找到品牌官方 guideline 页面的精确 HEX/Pantone 色值,DeepSeek 找到了,Haiku 即使 high 档跑 60 次工具调用也没找到,只能靠截图猜色。Haiku 唯一赢的 brief 是找论坛真实引语——但它只看 Exa 摘要从不开页面,来源可信度存疑。
任务二:聊天标题(52 条消息、关推理):DeepSeek 28 胜、Haiku 8 胜、9 平、7 相同,速度同为 1.1s。Haiku 的问题是常把标题写成回答的第一句,甚至一条 prompt injection 测试消息直接成了标题。
评测方法:Opus 盲评 A/B 双序,双序不一致记平局;作者承认 Claude 评 Claude 有同门偏差,但即便如此仍判 DeepSeek 胜。每组只跑一次,属个人测试非实验室级基准。
所属事件:开发者实测:DeepSeek V4.1 Flash 在 agent 任务中击败 Haiku 5.5(2 条相关)→
「模型」频道最新
- Polymarket 上线 Gemini Argon 发布时间赌盘,谷歌新模型再爆线索 — Polymarket · 2026-10-08
- 本地模型已死?博主「 repenting 」:混合智能才是 AI 部署的正道 — TheOyinbooke · 2026-10-08
- 用户实测:Chat 模式下 GPT-6 自称「GPT 5.6 Sol」 — Super_Pattern6594 · 2026-10-08
- Sebastian Raschka 长文:从词袋到 Jev,文本分类模型演进全解析 — AxSaucedo · 2026-10-08
- 开发者自测「夜火车基准」:GPT-6 Luna 比 Haiku 5.5 快 5 倍还便宜三分之二 — RexDouglass · 2026-10-08
- 开源权重会永远免费吗:领先时闭源收费才是理性选择 — Atlan_ · 2026-10-08