量化研究 agent 自我改进:密封沙箱挡住数据泄漏,样本外夏普 2.50

AQuA: Recursively Self-Improving Quantitative Trading Research Agents

Jiacheng Guo, Suozhi Huang, Yunlong Gao, Zihao Li, Jian Ge, Xu Kuang, Mengdi Wang

cs.CL, cs.AI

2026-08-13

AQuA 用密封沙箱加受限 DSL 让两个独立的 LLM 研究系统各自闭环自我改进,美股 30 分钟预测 IC 0.0843,策略 2021–2025 逐年为正。

这篇在解决什么

量化研究里,大模型 agent 已经能提假设、写实验、按反馈改方向,但有一个结构性风险:不受约束的 agent 会污染自己后续迭代所依赖的证据。一段偷偷读了未来数据的特征、一次在测试集上做的选择,都会变成高分假象,还会被存进记忆、在后续迭代里放大。Prompt 约束和模型互审都挡不住这类问题。Princeton、蚂蚁、Stanford 合作的 AQuA 用结构性手段回应:让泄漏型的动作根本做不出来。

方法

两个互相独立的研究系统,不共享 agent、记忆、候选空间。

核心设计是「不对称自由」:agent 在 DSL 内随便探索,评估器在自适应面之外。泄漏被拆成两条通道分别封堵。生成侧泄漏靠 DSL 封死:算子库里的时序算子只读过去窗口、截面算子只读当下时点,因果性在组合下封闭,agent 拼不出读未来数据的原语。选择侧泄漏靠指标分离封死:搜索期间 agent 只能看到事先固定的验证切片分数,2021–2025 测试窗只在配置冻结后打一次分,从不参与排序。

结果

系统一在加密货币 5 分钟频段,组合信号 IC 随迭代升到约 0.190;单因子普遍只有 0.026–0.037,强度来自因子库的组合。系统二预测美股 30 分钟收益,训练 2010–2019,2020 留作隔离带,2021–2025 是从未碰过的测试窗:

模型per-stock IC
线性 ridge+0.0251
LGB+0.0397
LSTM+0.0535
GRU+0.0613
混合模型(agent 迭代产出)+0.0843

比最强基线 GRU 绝对提升 0.023,相对提升 37.5%。转成对冲策略后,行业中性化把样本外夏普抬到 2.15,加因果波动率目标做到 2.50(双边成本 2bp),全因果 walk-forward 仍有约 2.0;2021 到 2025 逐年为正(1.7/3.5/1.9/1.8/2.7),2022 指数大跌年反而是最好的一年。

为什么重要

对做自动化研究的团队,泄漏的双通道划分可能比收益数字更有价值:生成侧靠受限 DSL 结构性封死,选择侧靠「优化的指标」与「汇报的指标」分离。这套构造对任何被评估器打分的自主研究 agent 都适用,不限于金融。论文附录还留了一个诚实的失败案例:一次靠 agent 互审漏掉的泄漏,说明「靠审」不如「靠封」。

局限与存疑

作者自己列得很清楚:每个系统只在单一市场、单一频段上验证(crypto 5 分钟、美股 30 分钟),数字不承诺迁移;全程有人类操作员定目标、管沙箱、监督晋级,不是无人值守;所有成绩是含换手成本的模拟,没有实盘验证。测试窗的隔离是治理约定,不是密码学保证,能接触存储的操作员理论上仍能看到它。部署的因子表达式与部分配置刻意未披露,可复现性打折;两个部分的 IC 口径不同,0.190 与 0.0843 不能直接比。

术语

原文与代码

社区讨论

相关论文

全部论文解读