FlowBank 入选 NeurIPS:互补 workflow 库预计算复用,五基准平均 73.40 胜基线
@furongh 发布线程介绍其团队入选 NeurIPS 的论文 FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse(arXiv:2606.1129),一个针对 LLM 多智能体系统的 workflow 层优化框架,并报告了在五个基准上的结果与后续研究方向。
已确认
- 核心洞察:许多 workflow 优化方法在候选中只保留一个「赢家」,但平均表现差的 workflow 往往恰好能解决赢家漏掉的查询,不应直接丢弃。
- 方法路线:采用「预计算并复用」——离线发现互补的 workflow 并压缩成紧凑的库,推理时为每个查询预测该执行库中哪个成员,以平衡性能与成本;同时保留 workflow 生成器,需要时仍可现场设计全新 workflow。
- 实验结果:跨五个基准平均得 73.40 分,对比所评测最强自动化基线的 70.40 分,且报告的平均推理成本更低;所有 agentic workflow 均使用同一个 GPT-4o mini 作为执行器。
- 库的规模效应:在 MATH 上,保留完整 workflow 池得 68.11 分,而经过筛选的小库得 69.34 分——尽管完整池在「完美选择」假设下潜力更大。结论是更大的库只有在善于选择时才有价值。
尚未确认
- FlowBank 目前离线构建 workflow 库,「在部署中学会复用、改造或新建 workflow」属于作者提出的下一步方向,尚无对应结果。
- 作者向 agent 开发者提出的开放问题——依据什么信号判断应复用、改造还是新建 workflow——为探讨性质,无结论。
为什么重要
该工作表明 workflow 层的优化不必在「单一赢家」与「每查询现造」之间二选一,通过小型互补库加按查询选择,可在同一执行模型上同时获得更高分数与更低推理成本,为多智能体系统的低成本部署提供了可行路径。
2026-10-05 ~ 2026-10-05 · 9 条相关
一手来源
- FlowBank 提出预计算复用方案,五项基准平均 73.40 分入选 NeurIPS — furongh ·
- 五项基准平均 73.40 对 70.40,FlowBank 更高分且推理成本更低 — furongh ·
- NeurIPS 论文 FlowBank:互补 workflow 库+按查询选择,平均 73.40 胜基线 — furongh ·
- 【源头】FlowBank 提出预计算复用方案,五项基准平均 73.40 分入选 NeurIPS — furongh · 2026-10-05
- FlowBank 思路:平均表现差的 workflow 恰好能补赢家的短板 — furongh · 2026-10-05
- FlowBank 离线建小型 workflow 库,推理时按查询预测调用哪个 — furongh · 2026-10-05
- MATH 实测:筛选 workflow 库比全量池多拿 1.2 分,大库需会选 — furongh · 2026-10-05
- FlowBank 下一步:让 workflow 库在部署中学会复用、改造或新建 — furongh · 2026-10-05
- 【源头】五项基准平均 73.40 对 70.40,FlowBank 更高分且推理成本更低 — furongh · 2026-10-05
- FlowBank 作者向 agent 开发者提问:何时复用、改造或新建工作流 — furongh · 2026-10-05