内部评测:DeepSeek V4.1 Flash 近 SOTA,成本仅为竞品 2%
himanshustwts · x · 2026-09-11
作者团队用同一批 22 个内部任务(覆盖工程、业务运营、金融、医疗)评测了 11 个前沿模型的实际工作表现:
- DeepSeek V4.1 Flash 在 KnowledgeWork 评测上拿到 15/21 通过,接近 SOTA,而价格比榜首 Fable 5.1(18/22 通过)便宜 98%。
- 最意外的结果是 GPT-6 Astra 仅通过 11/22。
- 作者称刚开始分析 agent 轨迹,后续会更新完整线程。
所属事件:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(15 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11