用强化学习做组合优化
PtrPomorski · x · 2026-07-19
这篇论文提出了一个用于大机构投资组合优化的动态框架 SciPhyRL(Scientific Physics-Informed Reinforcement Learning)。
核心做法是:把连续时间下的优化问题表述到扩展状态空间中,显式考虑累计成本;再利用离线历史数据学习分布感知的策略。作者进一步把原本难解的 HJB 方程投影到观测轨迹上,转成一类路径哈密顿-雅可比方程,并用 PINN 在一次离线求解中直接拟合,避免传统 value/policy iteration。为了适配短持有周期,控制变量从连续交易率改成离散目标持仓,同时用微观结构启发的二次冲击成本模型评估执行成本。
实验在一个 14 只资产的 ETF 集合上进行,并使用人工构造的 oracle signal。结果显示,学到的 Gibbs policy 在样本内和样本外都优于 equal-weight 和 behavioral 基线,Sharpe ratio 明显更高,同时能更好地控制波动和换手。
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22