可执行环境与团队协调双缩放,Apodex 金融基准拿到 54.3

Apodex 1.1: Scaling Agentic Intelligence for Complex Work

Apodex Team, B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei, C. Xue, C. Zhang, D. Ng, D. Ye, E. Min, F. Chen, F. Liu, F. Yang, F. Ye, H. Xu, H. Yang, H. Ye, H. Zhang, H. Zhao, J. Li, J. Lin, J. Xia, K. Jin, K. Wang, K. Yang, L. Bing, L. Lei, L. Su, Le. Wang, Lu. Wang, N. Wang, Q. Ren, Q. Yang, R. Li, S. Bai, S. Du, S. Li, S. Lin, S. Nie, S. Wang, S. Zhang, S. Z. Wang, Ta. Q. Fang, Ti. Q. Fang, W. Fang, W. Li, W. Zhang, X. Chen, X. Li, X. Tang, X. Wang, X. Xu, X. Zhang, X. Q. Wang, X. Y. Wang, Y. Deng, Y. Gao, Y. Hu, Y. Li, Y. Sui, Y. Wang, Y. Xiao, Y. Zhang, Z. Chen, Z. Cheng, Z. Feng, Z. Liang, Z. Zhang

cs.AI, cs.CL, cs.LG

2026-08-24

Apodex 1.1 把工作能力拆成环境缩放和协调缩放,在可执行文件、搜索、代码世界里训练。Agent Team 在 FrontierFinance 拿到 54.3、GDPVal 胜率 78.8,35B Mini 也明显超过 1.0。

这篇在解决什么

通用语言模型已经能推理、会写答案,但复杂工作还要求长时间跟文件、检索和代码打交道:状态要保住,失败要能恢复,交付物要可核验。现有评测多看单次回答,漏掉了这条轨迹上的能力。Apodex 把这种能力叫 working capability,并把它当成 Heavy-Duty Solver 的底座:判断标准是有没有把活做完,不是话写得像不像。

方法

两条缩放轴并行。Environment Scaling 把文件、搜索、代码做成可执行世界,各自带状态、工具、失败条件和交付核验。文件世界按职业铺开,登记了 33 个领域、318 个职业、1208 个交付簇;搜索世界考证据发现和对齐;代码世界用沙箱测试卡住「看起来过了其实没改对」的奖励黑客。Agentic Coordination Scaling 把分解、委派、异步回收和重规划写进策略本身。Agent Team 把计划外化到任务板,加上非对称核验(核验任务比生成窄,只打一条主张)和自适应 Max Team Effort。AgentOS 负责工作区、产物血缘和中途干预,并把输入、工作区和最终交付分成可读隔离的目录,避免中间草稿被当成交付物。训练是统一 SFT 再加 agentic RL,失败回流到 Task Pipeline;文中的 self-evolution 指这条受控工程环,不是放开让模型改自己的权重。

结果

主系统用 ReAct 和 Agent Team 两套脚手架对照。专业工作上,APEX-Agents 从 ReAct 的 34.4 升到 Agent Team 的 38.5,GDPVal 胜率从 69.5 升到 78.8。金融侧 FrontierFinance 从 48.7 升到 54.3,超过 GPT-5.6-Sol 的 46.8 和 Claude-Fable-5 的 49.2。科研侧 FrontierScience-Research 从 55.0% 升到 63.3%,超过 DeepSeek-V4-Flash-0731 的 55.0%。HLE 从 53.2 到 56.1,DeepSearchQA F1 从 88.2 到 92.4。数学上 IMO 2025 从 ReAct 的 24.3 到 Agent Team 的 36.5,IMO-ProofBench Advanced 从 46.4% 到 63.3%。编码是短板:Terminal-Bench 2.1 为 70.8,SWE-bench Verified 为 77.7,落后 Gemini 3.6 Flash 的 91.9 和 Claude Opus 5 的 92.2。35B Mini 在 FrontierFinance 上 ReAct 从 1.0 的 33.2 升到 40.0,Agent Team 再升到 50.2。

设置FrontierFinanceGDPVal 胜率FrontierScience-Research
Apodex 1.1 ReAct48.769.555.0%
Apodex 1.1 Agent Team54.378.863.3%
GPT-5.6-Sol46.879.3未报
Claude Opus 5未报89.4未报

为什么重要

从业者真正缺的往往不是更会答题的模型,是能在文件、检索、代码里把活做完、失败还能接着干的系统。这篇把环境和协调当成两条可缩放的轴,并且用同一套 harness 采集训练轨迹和跑线上任务,避免「训练时一套、部署时另一套」。35B Mini 在金融和 APEX 上跨代拉开,说明可执行环境和团队协调不只是大模型才吃得开。如果只看编码仓库修补,它还不是第一梯队。

局限与存疑

编码明显落后于 Claude Opus 5 和 Gemini。内部 FrontierResearchBench 上 Agent Team 全分通过率只有 12.4%,GPT-5.6-Sol + Codex 也才 20.6%。BioMysteryBench 困难集 35.3%,低于 Opus 5 的 49.4%。GDPVal 外部数字是在自家 harness 里复现的,跨系统对比会掺脚手架差异。旗舰参数量正文没有单独列表,HDS6 切片里出现过 397B;Mini 明确是 35B。YC-Bench 没有单独报 Agent Team。内部搜索/科研基准不公开,外部无法复核。

术语

原文与代码

相关论文

全部论文解读