22 项知识工作实测 DeepSeek-V4.1-Flash,全程仅花 $0.34
realsohamparekh · x · 2026-09-10
博主 himanshustwts 在内部 22 个知识工作任务(工程、金融、医疗等)上实测刚发布的 DeepSeek-V4.1-Flash,任务平均含 120+ 验证器、以 GPT-5.5 为裁判,整套跑完成本仅 $0.34。
擅长:处理带优先级、豁免和生效日期的长政策并交互应用;将多份 CSV/文档/修订案调和为一致输出;量化与金融推理;长上下文;甚至通过了隐藏的语义泛化测试。
短板:生成摘要计数时难以区分主要发现与次要发现;无法完全穷尽备忘录要求,有时解决了底层审计问题却漏掉某项必需的对比或解释。
同帖引用 DeepSeek 官方发布:V4.1-Flash 是其新架构家族中最小的模型,具备原生视觉理解,主打更快推理与更高吞吐。第三方评测数据未经官方证实。
所属事件:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(15 条相关)→
「模型」频道最新
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- Anthropic 发布最详细威胁情报报告,曝 Claude 遭滥用案例 — typewriters · 2026-09-11