22 项知识工作实测 DeepSeek-V4.1-Flash,全程仅花 $0.34

realsohamparekh · x · 2026-09-10

博主 himanshustwts 在内部 22 个知识工作任务(工程、金融、医疗等)上实测刚发布的 DeepSeek-V4.1-Flash,任务平均含 120+ 验证器、以 GPT-5.5 为裁判,整套跑完成本仅 $0.34。

擅长:处理带优先级、豁免和生效日期的长政策并交互应用;将多份 CSV/文档/修订案调和为一致输出;量化与金融推理;长上下文;甚至通过了隐藏的语义泛化测试。

短板:生成摘要计数时难以区分主要发现与次要发现;无法完全穷尽备忘录要求,有时解决了底层审计问题却漏掉某项必需的对比或解释。

同帖引用 DeepSeek 官方发布:V4.1-Flash 是其新架构家族中最小的模型,具备原生视觉理解,主打更快推理与更高吞吐。第三方评测数据未经官方证实。

所属事件:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →