大模型怎么拆单执行?深交所实测 PACE 比 TWAP 每单省 0.65 个基点

Can Large Language Models Execute Parent Orders?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

cs.CE, cs.CL, q-fin.TR

2026-07-30

PACE 把母单执行拆成长程规划加短程执行两层,用大模型在推理时决策,在深圳证券交易所数据上比最强基线高 0.65 个基点,而且模型越自信表现越好、倾向早交易,跟人类相反。

这篇在解决什么

算法交易里有个核心问题叫母单执行(parent-order execution):手里有一笔很大的单子,一次性砸出去会暴露意图、也来不及随市场调整,拿到更差的成交价。母单执行就是把大单拆成若干小单,边走边决定每个时刻交易多少,目标是买得更低、卖得更高。

已有做法两条路。静态策略(TWAP、Almgren-Chriss)对市场行为做简化假设,比如假设日内成交量分布固定,在这些假设下交易;但真实市场未必服从,模型参数还会随时间漂移。学习型策略用数据训出自适应策略,但要专门设计奖励、状态、动作,换到新场景就得重训。这篇问的是:大模型能不能干母单执行这件事?它把大模型在金融里的用途从「交易什么」推到了「怎么执行」。

方法

PACE(Plan-Ahead Controlled Execution)是个分层框架,既不预设市场假设,也不做任务专用训练,决策都在推理时生成。它把母单执行拆成两层。

输入有三部分:母单(股票、方向、起止时间、总量)、市场历史(过去 L 分钟的价量序列,用买卖一档的中间价作股价代理)、TWAP 曲线(把总量均匀摊到每个决策点,是最朴素的基线)。

Planner 负责长程规划。它对整个执行窗口做一段文本化的趋势判断,输出一组分配分数和总体置信度 c。分数再跟 TWAP 的均匀分配混合,λ 控制 LLM 占比,λ 大就更听模型的,λ 小就更贴 TWAP。这步把总量切成 N 个子计划。

Executor 负责短程执行。给定一个子计划,它结合市场历史、Planner 的长程趋势判断、TWAP 基线量,在每个决策点微调交易量(γ 控制),力争在局部价格更优时多成交。回测环境建在深圳证券交易所 Level-1 行情上。模型试了 GPT-5.4 和 DeepSeek V4 Flash(DS-v4-f)。

结果

1680 个母单上(总成交约 3560 万美元),PACE 全面超过静态和学习型基线,所有策略都 100% 完成执行。

策略类别激进设置 wbp比 TWAP 的增益
TWAP静态-3.28
Almgren-Chriss静态-2.93+0.35
XGBoost学习-3.10+0.18
LSTM学习-2.91+0.37
GPT-5.4大模型-2.76+0.52
DS-v4-f大模型-2.26+1.02

最强变体 DS-v4-f 激进设置下比 TWAP 高 1.02 个 bps(95% 置信区间 0.15 到 2.12,p=0.002),比最强基线高 0.65 bps;被动设置下分别高 1.07 和 0.71 bps(p=0.014)。1 bps 在年交易 1000 亿美元的基金上约合 1000 万美元,作者据此估算这 0.65 bps 相当于每年省 650 万美元。整批实验的 LLM API 成本只有约 30 美元。

增益在分组里普遍成立:卖单增益更大(中国融券限制让负面信息进价更慢,留了执行空间);波动率高和低两组都赢,对噪声比学习型策略更稳。消融里去掉 Planner 或 Executor 都掉点,Planner 贡献更大;去掉买卖方向指引或市场术语解释也都退步,说明清晰的交易指引有用,但大模型即便没有这些也保留了执行能力。

几个回归揭示了 LLM 做执行跟人很不一样。第一,模型越自信表现越好:Planner 置信度 c 对成交表现 bp 的回归系数显著为正(p<0.01),跟人类「过度自信反而亏钱」(Odean 1999)正相反。第二,模型倾向早点交易:Executor 把交易量放在时间压力低的时候,时间压力 TP 的系数显著为负,跟人类爱拖到截止前正好相反(Steel 和 König 2006)。第三,DS-v4-f 的决策没法用简单的趋势跟随或均值回归解释(近期收益 LR 系数不显著),GPT-5.4 的则部分跟着近期趋势走。

为什么重要

它第一次系统地把大模型放进母单执行这个真问题里,效果虽小但在量级上有经济意义,推理成本极低。更值钱的是行为发现:大模型做执行比人更守纪律,该早交易就早交易,自信反而靠谱,这指向「LLM 补足人类交易员」的角色定位,而不是取代。

局限与存疑

这毕竟只是回测,没上实盘,作者也把实盘验证列为未来工作。效应量 0.65 bps 不大,能不能在真实摩擦、冲击成本和市场结构变化下保住,要实盘说话。市场和资产都单一(深圳 A 股),输入也只有价量和 TWAP,没纳入新闻、微观结构、跨资产信号。判分用的是回测里模拟成交,跟实盘成交有差距。

术语

原文与代码

全部论文解读