实测称 DeepSeek-V4.1-Flash 刷新开源模型「Boeing 基准」,长程任务数小时不宕
victormustar · x · 2026-09-11
独立开发者 victormustar 补充实测细节,称 DeepSeek-V4.1-Flash 是他见过开源模型中 Boeing 基准(一项飞机类长程模拟任务)的最佳成绩:
- 借助 /goal 模式连续运行数小时,其他模型往往很快停滞,该模型保持「检查—发现缺陷—放大—诊断—修复—重复」的循环持续改进。
- 突出亮点是长时程(long horizon)任务中的持续性与自主判断该修什么的能力。
为第三方实测评价,非官方发布。
所属事件:开发者实测 DeepSeek-V4.1-Flash 刷新开源 Boeing 基准(2 条相关)→
「编程与Agent」频道最新
- 用Codex生成Remotion动效再喂给MiniMax H3出片 — Hailuo_AI · 2026-09-11
- Reddit 网友发问:为何没有面向 Agent 运行时而非模型的基准测试? — Balance- · 2026-09-11
- 西班牙开发者将 PISA 数据预处理成 AI Agent 可直接分析的开源数据集 — pelayoarbues · 2026-09-11
- 手机维修店老板用 Codex 加浏览器 Agent 自动比价下单 — ZealousidealGuide882 · 2026-09-11
- 曝 OpenAI 内部用 Codex 构建了可以『自举』的自主 Agent 平台 — reach_vb · 2026-09-11
- Computer Use 演进三段论:从 GUI 操作走向自进化 Agent — TianbaoX · 2026-09-11