FactorBench: A Portfolio-Aware Benchmark for Automated Factor Mining
Zhuohan Wang, Carmine Ventre
q-fin.PM, cs.LG
2026-10-03
五大股市统一评测约 5000 个 AI 挖掘因子,GP、RL、生成式、LLM agent 四种范式无一持续占优,2016 年手写的 Alpha101 在组合层仍有竞争力。
自动因子挖掘要从行情数据里搜出能预测未来收益的股票打分函数。这条线的方法这几年迭代很快:遗传编程(GP)靠变异交叉进化表达式,强化学习和生成式模型学着构造公式,最新的 LLM agent 自己提金融假设、写代码、按回测反馈迭代。问题在于每篇论文的数字都产自各自的数据、目标和回测管线,方法之间没法横向比;更根本的是,搜索阶段优化的 IC 只是中间代理指标,挖掘系统交付的是一批信号,这批信号出了搜索环境活不活得下来、拼在一起赚不赚钱才是终点。FactorBench(King's College London)把从挖掘到组合的完整链路塞进同一套契约里测。
流水线分四块:
两个设计细节决定结论含金量:因子正负号只用训练期 IC 定死,验证测试期原样沿用,样本外翻号直接显形;残差 IC 先把因子对 beta、波动率、动量、短期反转、流动性做截面回归,再算剩余部分的 IC,用来区分新信息和重新发现的已知风格。
4914 个候选因子里 98.5% 可执行、95.6% 可评分(每个时间段至少 100 个有效交易日)。76 个执行失败全部出自 LLM 管线(R&D-Agent 19、AlphaAgent 24、QuantaAlpha 33),符号搜索方法的损耗主要来自数值退化。单次运行耗时从 GP 的 0.14 小时到 QuantaAlpha 的 27.9 小时。
时间泛化上,GP、RL、生成式方法训练期 IC 明显更高,进验证期大幅缩水,测试期基本不回来;LLM 方法差距小,是因为训练期本来就没多高,样本外并没有更准。
组合层(测试期,ridge 合成,20 天调仓,交易成本 10 个基点):
| 方法 | 合成 IC | 残差 IC | 多头 CAGR / Sharpe | 多空 CAGR / Sharpe |
| Alpha101(参照) | 0.0238 | 0.0237 | 26.5% / 1.24 | 2.6% / 0.32 |
| GP | 0.0165 | -0.0128 | 30.4% / 1.17 | 3.7% / 0.34 |
| AlphaQCM | 0.0191 | 0.0175 | 29.6% / 1.31 | 3.7% / 0.67 |
| R&D-Agent | 0.0253 | 0.0011 | 31.2% / 1.19 | 6.5% / 0.68 |
| AlphaAgent | 0.0030 | -0.0025 | 22.4% / 1.03 | 0.3% / -0.09 |
几个读数:多头组合全部为正(年化 22.4%–31.2%),多空对冲后只剩 0.3%–6.5%,多头收益的大头是市场涨幅;R&D-Agent 原始 IC 最高,中性化后从 0.0253 掉到 0.0011,GP、AlphaGen、AlphaForge、AlphaSAGE、AlphaAgent 的残差 IC 直接转负;AlphaQCM 保留最多,Alpha101 几乎不动;多空设定下 R&D-Agent 和 AlphaQCM 的 Sharpe 最高,AlphaAgent 转负。Alpha101 这套 2016 年的手写公式在每一层都没掉队。
池层还有个反直觉结果:LLM 挖出的因子池比非 LLM 搜索更接近已发表的 Alpha101,R&D-Agent 最明显,预训练的金融知识让它们偏爱已知概念;AlphaGen 和 AlphaQCM 池内冗余最高。
对 AI4Finance 从业者,这篇的作用是校准预期。LLM agent 挖因子看起来是自动化研究的捷径,但在这套统一评测里,样本外优势不存在,原始预测力有相当一块是已知风格暴露,产出还更贴公开公式。往后看到只报搜索目标分数的因子挖掘工作,可以拿这套三层协议重新审一遍。基准代码开源,五个市场、统一字段、统一切分,当复现底座很顺手。这是泼冷水的 benchmark 论文,没有新方法,但负面结论有信息量。
作者自己列得很全:结论限于被评测的实现与共享任务,不等于范式的本质能力;五个大市值市场、单一 20 日目标、单一时间切分、三个种子;各方法预算沿各自论文设定,耗时不是受控的效率对比;残差 IC 只控五个暴露,不是纯 alpha;数据没有行业分类;股票池固定、不重建历史成分,有幸存者偏差,费用和融券假设也做了简化。
读下来还要再打点折:数据是 Yahoo Finance 日线,复现性好,但离机构实操的数据面差着量级;三个 LLM 方法共用一个 Qwen3.8-27B,「LLM agent 不占优」对更大或闭源模型是否成立,测不出来;多头正收益集中在 2024–2025 测试段,换个熊市切分未必复制;R&D-Agent 交 Python、其余交表达式,搜索空间本来就不对等,执行契约只抹平了评估端。Alpha101 参照只收了 71/101 条。