DeepSeek V4.1 Flash 盲测登国产第一,换客户端暴跌近 17 分
teortaxesTex · x · 2026-09-09
一组 7 个「模型+编程客户端」同题盲测显示:同一份生产级代码任务、同一安全问题、完全隔离沙盒下,DeepSeek V4.1 Flash + Claude Code 以 76.69 分拿下国产模型第一,超过 Qwen 3.8 Flash(75.13)、Kimi K3-256K(70.73)、Qwen 3.8 Max(69.58)和 GLM 5.3(64.72)。
- 赢在:安全隐私 88 分、失败/并发安全与性能单项最高,缓存命中率全程 99%+,49 分钟跑完,比大参数模型更快。
- 输在:功能正确性 78 分不敌 Qwen 3.8 Flash 的 82;失败安全绝对分仅 54,事务与并发路径仍弱;测试质量、架构、兼容性等均非单项第一。
- 最大变量是客户端:同一模型换到 DSH 宿主后直接掉 16.77 分(59.92),工具接入与执行流程差异巨大。
结论:Flash 已能对标旗舰,但工程边角未打满,客户端适配是当前最大变量;且这是单任务工程评测,不代表通用能力排名。
「编程与Agent」频道最新
- AI Engineering Buildcamp 公布六大实战项目,覆盖 RAG 到多智能体 — Al_Grigor · 2026-09-09
- Reddit 讨论:大家的多模型 Agent 工作流到底怎么搭? — Necessary-Apple337 · 2026-09-09
- 网友开源 CLI:输入公众号文章链接自动导出 Markdown — vista8 · 2026-09-09
- 月跑千次编码 Agent 算账:最大成本不是任务,是静默重试 — mrtrly · 2026-09-09
- 编码 Agent 的绿灯测试套件只证明会写测试,不证明功能可用 — Future_AGI · 2026-09-09
- threepointone:副业项目该从做网站转向造对抗自主攻击的「个人装甲」 — threepointone · 2026-09-09