LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang
cs.CL
2026-08-24
778道可机器验收的长工作流题上,Opus跑通过的252条Gene让七个模型相对Skill提高8.7到15.5个百分点;没过关就蒸馏的Gene全面落后。
模型现在常被要求把一整条工作流做完:接口、顺序、边界、跨文件一致性,缺一块,交付物就过不了机器校验。一次跑通的经验通常用完即扔,下一台模型还得从零摸失败模式。Skill 这类手续知识能告诉模型「按规定怎么做」。EvoMap 想问另一件事:校验器确认过的执行轨迹,收成结构化 Gene 之后,能不能当可复用的外部经验。
现成基准很少在同一套任务、运行时和校验器下,把「无上下文 / Skill / Gene」并排打。LongWoF-Bench 就是为这次对照搭的。
任务写成 (规格, 环境, 交付空间, 校验器)。成功只看最终交付物是否整份过关,不看中间步骤像不像。校验器用可执行测试、隐藏检查或规范化精确匹配,模型看不到金标、参考解和校验逻辑,但过关所需信息都在公开规格里。
基准收了 778 道机器可验题:代码生成 341、agent 环境合成 127、数学推理 151、规则遵循 159。代表题是自适应巡航:公开规格给车辆参数、150 秒传感器轨迹和性能约束,模型要交出控制器、仿真器和报告,私有评估器会重跑并查接口与行为。
Gene 按 Evolver 的执行-校验-修订来。生产者先盲做;失败则在清洗过的校验反馈上改,直到预算内跑通。被修订的是题解,不是 Gene。通过后再蒸馏出策略、前置检查、边界和失败守卫。主集用 Claude Opus 4.8 当生产者,得到 252 条校验确认的 Gene。对照条件三种:无上下文、Skill、EvoMap Gene。七个消费模型覆盖 Anthropic、Gemini、MiniMax、Qwen。每题每条件只记一次尝试,推理时不再给校验反馈。
主对比钉在这 252 题上。七模型平均严格通过率:无上下文 41.0%,Skill 51.2%,Gene 62.9%。Gene 对 Skill 的提升在全部七个模型上都是正的,8.7 到 15.5 个百分点,McNemar 全部显著。
| 消费模型 | Skill | Gene | 差 |
| Claude Opus 4.8 | 63.9% | 79.4% | +15.5 |
| Claude Sonnet 4.6 | 55.6% | 66.3% | +10.7 |
| Gemini 3.1 Pro | 63.1% | 72.2% | +9.1 |
| MiniMax M3 | 50.4% | 63.5% | +13.1 |
| Qwen3.5-397B | 48.4% | 61.9% | +13.5 |
| Qwen3-Coder-30B | 31.8% | 43.2% | +11.5 |
| Gemini 3.1 Flash-Lite | 45.2% | 54.0% | +8.7 |
Opus 自己用 Gene 过了 200 题、Skill 过了 161 题,多 39 道,解题期 token 从 803,099 降到 723,480,少 9.9%。多轮发现这 252 条轨迹花了 404 次调用、1,333,968 token;一次复用 252 次调用、723,480 token,token 少 45.8%。这不是同等成功率替换:发现端 252 全过,复用端过 200。
经验从哪来,比长成 Gene 更关键。Opus 预算内没跑通、只能从参考侧教师信号蒸馏的 526 题上,Gene 对七个模型全面落后 Skill,3.3 到 11.3 个百分点。两边题集不同,只能当来源相关证据,不是同题消融。Opus 和 Gemini 都能跑通的 180 题上,Opus 产的 Gene 对每个消费者都强过 Gemini 产的,差 4.4 到 11.7 个百分点。
分族也不匀。agent 环境和规则遵循上 Gene 最稳,分别高 15.6 到 29.7、2.1 到 22.9 个百分点。代码生成有三处小幅回退,1.7 到 4.9 分。数学上 Opus 从 43.3% 跳到 83.3%,若干其他模型打平或回退;Gemini Flash-Lite 和 Qwen3-Coder 在三种条件下都是 0。Gene 能搬走公式和边界约定,搬不走消费模型自己算不准的那一步。
Skill 教手续,Gene 教「校验器真正会卡的那条语义」。钻孔化验组合题里,后来区间覆盖这种看起来合理的约定过不了;通过轨迹是在每个断点切开、段内平均、再按长度加权。紧急调度题里,武器在场并不压过距离阈值,相等也不触发。这些不是通用流程说明,是过关所需的具体约定。
对要做长工作流 agent 的人,这更接近可外置的已验证记忆:发现成本付一次,后面的模型和轮次可以摊薄。前提是轨迹真的过了校验。没有过关轨迹,压缩成 Gene 会拖后腿。
主结论绑在 Opus 已经能解的 252 题上。解不出才退化的 526 题上,Gene 全面落后 Skill。每题每条件一次尝试,没有重复 API 方差。发现对复用不是同等成功率对比,蒸馏和审计的一次性成本也没计入。生产者是 Opus,Gene 可能带上 Opus 自己的约定。基准和 EvoMap 出自同一实验室,Skill 的写法是否被同等打磨,外部不好核对。数学题暴露了上限:经验转移补不了消费模型的计算能力。