TradingAgents: Multi-Agents LLM Financial Trading Framework
Yijia Xiao, Edward Sun, Di Luo, Wei Wang
q-fin.TR, cs.AI, cs.CE, cs.LG
2024-12-28
把分析师、多空研究员、交易员、风控拼成一家 LLM 交易公司,在苹果等三只科技股的三个月回测里累计回报 23% 起,超过所有量化基线。
用 LLM 做交易这件事,前人试过两条路。一是把 LLM 当单一工具,比如让它给新闻打情绪分,再套进传统量化策略;二是搭一个多智能体,让它们自由聊天决策。第二条路听着高级,实际有个老毛病:agent 之间靠自然语言长聊,信息像传话游戏一样逐轮衰减,关键细节埋在冗长对话里被冲淡。
这篇要解决的是,能不能像一家真实券商那样,把分工和流程硬化成结构,让 LLM 智能体各司其职、信息不靠口口相传。
框架把一家交易公司拆成五个环节、七个角色。分析师团队四人:基本面、情绪、新闻、技术分析。情绪分析师配了网页搜索、Reddit 和 X 的检索接口加情绪打分算法;技术分析师能跑代码、算 MACD、RSI、布林带等 60 个技术指标。四个人各出一份结构化报告。
接着是多空研究员团队,一个看多、一个看空,用自然语言辩论 n 轮(n 由主持 agent 决定),辩完由主持 agent 翻历史记录、采纳占优一方。这是论文刻意保留自然语言的地方,因为辩论要的是观点交锋,不是传数据。
交易员拿到研究员结论,决定买卖时点和仓位;风控团队按激进、中性、保守三种偏好反复审视计划;最后由基金经理拍板执行。
有两处设计选择要单独讲。第一,智能体之间默认走结构化文档和图表(借鉴 MetaGPT),自然语言只用在辩论上。这是直接对着传话游戏开刀:报告保住关键内容、过滤无关信息,信息不再随对话轮次流失。第二,所有 agent 统一用 ReAct 提示框架(先推理再调工具行动),底层模型按任务难度分工:gpt-4o-mini 和 gpt-4o 跑总结、取数、表格转文字这类快活,o1-preview 跑做决策、写证据型报告这类重推理。整套不烧 GPU,只花 API 额度。
回测区间 2024 年 1 月 1 日到 3 月 29 日,标的苹果、谷歌、亚马逊三只大盘科技股(正文也提到英伟达、微软、Meta,但主表只列这三只)。数据涵盖行情、新闻(Bloomberg、Yahoo、EODHD、FinnHub、Reddit)、社媒情绪(Reddit、X)、内部人交易(SEDI)和财报,每只票 60 个技术指标,且只用每个交易日当时能拿到的数据,排除未来信息(无前视偏差)。基线五条:买入持有、MACD、KDJ&RSI、ZMR、SMA。
主表四项指标(累计回报 CR、年化回报 AR、夏普 SR、最大回撤 MDD):
| 标的 | TradingAgents CR | 同标的最强基线 CR | TradingAgents SR | MDD |
| AAPL | 26.62%(年化 30.5%) | KDJ&RSI 2.05%(B&H -5.23%) | 8.21 | 0.91% |
| GOOGL | 24.36%(年化 27.58%) | B&H 7.78% | 6.39 | 1.69% |
| AMZN | 23.21%(年化 24.90%) | B&H 17.1% | 5.60 | 2.11% |
论文用「至少 23.21% 累计回报、24.90% 年化」做标题结论,并强调在波动最大的 AAPL 上,传统方法的形态规律失效,TradingAgents 反而拿到 26% 以上。相对各标的最强基线,累计回报分别高出 24.57、16.58、6.10 个百分点。
对从业者有两层价值。工程层面,这是个可配置的金融软件范本:底层模型、数据源、角色数量都能插拔替换,换 backbone 不用重训,加一个宏观分析师角色也不用动别的部分。结构化通信的思路也不限于交易,任何因为 agent 长聊导致信息衰减的多智能体系统都能借鉴。另一层是诚实:作者没把这包装成能上线的印钞机,反复强调这是回测、未来工作才是实盘。
这一节最有信息量,因为作者自己先泼了冷水。夏普通常 2 算不错、3 算优秀,而这里三只票的 SR 高到 5.60 到 8.21,作者明说「超出了我们预期的经验区间」,并归因于回测期内回撤太少、策略几乎没怎么亏钱。他们专门导出完整决策序列核对计算,确认数字没算错,但数字高得离谱这件事没回避。
仍有三点存疑。其一,样本太小:主表只有三只大盘科技股、三个月、且是 2024 年初的牛市,一只票、一段熊市就可能把结论翻过来。其二,成本压死了实验规模:每次预测要 11 次 LLM 调用加 20 次以上工具调用,只够跑三个月回测,这也意味着没法在更长历史、更多标的上验证。其三,论文没有建模交易成本和滑点;在 MDD 只有 0.91% 的设定下,手续费和买卖价差完全可能吃掉相当一部分账面回报。在没有实盘数据之前,23% 这个数字应当当成架构可行性的证据,而不是收益预期。