DeepSeek V4.1 Flash 盲测登国产第一,换客户端暴跌近 17 分

teortaxesTex · x · 2026-09-09

一组 7 个「模型+编程客户端」同题盲测显示:同一份生产级代码任务、同一安全问题、完全隔离沙盒下,DeepSeek V4.1 Flash + Claude Code 以 76.69 分拿下国产模型第一,超过 Qwen 3.8 Flash(75.13)、Kimi K3-256K(70.73)、Qwen 3.8 Max(69.58)和 GLM 5.3(64.72)。

结论:Flash 已能对标旗舰,但工程边角未打满,客户端适配是当前最大变量;且这是单任务工程评测,不代表通用能力排名。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →