Can Large Language Models Execute Parent Orders?
Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang
cs.CE, cs.CL, q-fin.TR
2026-07-30
PACE 把母单执行拆成长程规划加短程执行两层,用大模型在推理时决策,在深圳证券交易所数据上比最强基线高 0.65 个基点,而且模型越自信表现越好、倾向早交易,跟人类相反。
算法交易里有个核心问题叫母单执行(parent-order execution):手里有一笔很大的单子,一次性砸出去会暴露意图、也来不及随市场调整,拿到更差的成交价。母单执行就是把大单拆成若干小单,边走边决定每个时刻交易多少,目标是买得更低、卖得更高。
已有做法两条路。静态策略(TWAP、Almgren-Chriss)对市场行为做简化假设,比如假设日内成交量分布固定,在这些假设下交易;但真实市场未必服从,模型参数还会随时间漂移。学习型策略用数据训出自适应策略,但要专门设计奖励、状态、动作,换到新场景就得重训。这篇问的是:大模型能不能干母单执行这件事?它把大模型在金融里的用途从「交易什么」推到了「怎么执行」。
PACE(Plan-Ahead Controlled Execution)是个分层框架,既不预设市场假设,也不做任务专用训练,决策都在推理时生成。它把母单执行拆成两层。
输入有三部分:母单(股票、方向、起止时间、总量)、市场历史(过去 L 分钟的价量序列,用买卖一档的中间价作股价代理)、TWAP 曲线(把总量均匀摊到每个决策点,是最朴素的基线)。
Planner 负责长程规划。它对整个执行窗口做一段文本化的趋势判断,输出一组分配分数和总体置信度 c。分数再跟 TWAP 的均匀分配混合,λ 控制 LLM 占比,λ 大就更听模型的,λ 小就更贴 TWAP。这步把总量切成 N 个子计划。
Executor 负责短程执行。给定一个子计划,它结合市场历史、Planner 的长程趋势判断、TWAP 基线量,在每个决策点微调交易量(γ 控制),力争在局部价格更优时多成交。回测环境建在深圳证券交易所 Level-1 行情上。模型试了 GPT-5.4 和 DeepSeek V4 Flash(DS-v4-f)。
1680 个母单上(总成交约 3560 万美元),PACE 全面超过静态和学习型基线,所有策略都 100% 完成执行。
| 策略 | 类别 | 激进设置 wbp | 比 TWAP 的增益 |
| TWAP | 静态 | -3.28 | — |
| Almgren-Chriss | 静态 | -2.93 | +0.35 |
| XGBoost | 学习 | -3.10 | +0.18 |
| LSTM | 学习 | -2.91 | +0.37 |
| GPT-5.4 | 大模型 | -2.76 | +0.52 |
| DS-v4-f | 大模型 | -2.26 | +1.02 |
最强变体 DS-v4-f 激进设置下比 TWAP 高 1.02 个 bps(95% 置信区间 0.15 到 2.12,p=0.002),比最强基线高 0.65 bps;被动设置下分别高 1.07 和 0.71 bps(p=0.014)。1 bps 在年交易 1000 亿美元的基金上约合 1000 万美元,作者据此估算这 0.65 bps 相当于每年省 650 万美元。整批实验的 LLM API 成本只有约 30 美元。
增益在分组里普遍成立:卖单增益更大(中国融券限制让负面信息进价更慢,留了执行空间);波动率高和低两组都赢,对噪声比学习型策略更稳。消融里去掉 Planner 或 Executor 都掉点,Planner 贡献更大;去掉买卖方向指引或市场术语解释也都退步,说明清晰的交易指引有用,但大模型即便没有这些也保留了执行能力。
几个回归揭示了 LLM 做执行跟人很不一样。第一,模型越自信表现越好:Planner 置信度 c 对成交表现 bp 的回归系数显著为正(p<0.01),跟人类「过度自信反而亏钱」(Odean 1999)正相反。第二,模型倾向早点交易:Executor 把交易量放在时间压力低的时候,时间压力 TP 的系数显著为负,跟人类爱拖到截止前正好相反(Steel 和 König 2006)。第三,DS-v4-f 的决策没法用简单的趋势跟随或均值回归解释(近期收益 LR 系数不显著),GPT-5.4 的则部分跟着近期趋势走。
它第一次系统地把大模型放进母单执行这个真问题里,效果虽小但在量级上有经济意义,推理成本极低。更值钱的是行为发现:大模型做执行比人更守纪律,该早交易就早交易,自信反而靠谱,这指向「LLM 补足人类交易员」的角色定位,而不是取代。
这毕竟只是回测,没上实盘,作者也把实盘验证列为未来工作。效应量 0.65 bps 不大,能不能在真实摩擦、冲击成本和市场结构变化下保住,要实盘说话。市场和资产都单一(深圳 A 股),输入也只有价量和 TWAP,没纳入新闻、微观结构、跨资产信号。判分用的是回测里模拟成交,跟实盘成交有差距。