用强化学习做组合优化

PtrPomorski · x · 2026-07-19

这篇论文提出了一个用于大机构投资组合优化的动态框架 SciPhyRL(Scientific Physics-Informed Reinforcement Learning)。

核心做法是:把连续时间下的优化问题表述到扩展状态空间中,显式考虑累计成本;再利用离线历史数据学习分布感知的策略。作者进一步把原本难解的 HJB 方程投影到观测轨迹上,转成一类路径哈密顿-雅可比方程,并用 PINN 在一次离线求解中直接拟合,避免传统 value/policy iteration。为了适配短持有周期,控制变量从连续交易率改成离散目标持仓,同时用微观结构启发的二次冲击成本模型评估执行成本。

实验在一个 14 只资产的 ETF 集合上进行,并使用人工构造的 oracle signal。结果显示,学到的 Gibbs policy 在样本内和样本外都优于 equal-weight 和 behavioral 基线,Sharpe ratio 明显更高,同时能更好地控制波动和换手。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →