DeepSeek V4.1 Flash 横扫 60 项浏览器任务,agent 成本仅为对手 1/50
airesearch12 · x · 2026-09-11
转发自 gregpr07:一份覆盖 60 个高难度浏览器操作任务的基准显示,DeepSeek V4.1 Flash 处于性价比的 Pareto 前沿。
- 在相近性能下,记录到的 agent 使用成本比 Sol 和 Opus 低约 50 倍
- 整个数据集跑一遍的开销,比用 Sol 跑单个任务还便宜
该数据强调极端浏览器任务下的成本-性能权衡,若属实将大幅降低浏览器 agent 的规模化门槛(数据来自第三方,具体评测方法待核实)。
「编程与Agent」频道最新
- 独立游戏开发者:AI 接管数百个变量维护,省下精力专注创作 — round · 2026-09-11
- CursorBench 4.0 发布:任务更难更长程,各家模型得分集体下降 — StringChaos · 2026-09-11
- AI 写的 PR 漏掉鉴权检查:两个审查者都没发现越权漏洞 — Mangwe_Tanser · 2026-09-11
- 模型成本一变就重排 agent 流水线?多阶段路由信号怎么选 — Katleen_Cole · 2026-09-11
- 开发者大会演讲:从简单起步,逐步规模化应用编码Agent — therealdanvega · 2026-09-11
- OpenAI Agents API 会话跑在 Daytona 沙箱:外拨注册、零入站端口 — mattturck · 2026-09-11