FinanceHarness: Autonomous Financial Deep Research Framework
Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee
cs.CL, cs.AI, q-fin.CP
2026-07-30
金融深度研究基准 FinanceGym 用时间点隔离防信息泄露;最强代理整体才 34%,预测未来那部分全线个位数,难点在预测而非检索。
通用深度研究代理(deep research agent)写的是面面俱到的报告,但金融研究不是这个玩法。分析师要做两件很不一样的事:一是把历史规律、行业背景、数字证据串起来,二是预测还没发生的事件(下季度业绩、政策拐点、并购动向)。前者是检索加综合,后者是外推加判断,通用 agent 在第二件上基本无能为力。
更麻烦的是评测。金融预测研究一旦用真模型做基准,最怕的就是「信息泄露」:测试集里混进了截止日期之后的资料,agent 看着像神预测,其实是开了天眼。已有的深度研究基准大多不防这一手。
论文给两样东西。一是 FinanceGym,一个金融深度研究基准,400 道专家标注的 thesis-driven 题目、2464 条评分细则(rubric)。每题有一个截止日期,核心是「时间点隔离」(point-in-time):agent 能查的语料库(FAISS 检索)在截止日期处被切干净,未来的资料一律不可见。评分也分两半,pre-cutoff(用截止前证据能答的历史与规律题)和 post-cutoff(必须预测未来的题),由一个独立的 LLM judge 按 0-4 五档打分。专家审过这套基准,通过率 82%。
二是 FinanceHarness,一个开源 harness(主骨干 Qwen3.6-27B)。它的核心设计是「分层工具接口」而非单一通用搜索:核心循环常驻(PIT 搜索、读源、组引用、定稿),估值、可比公司、风险分析等进阶工具按需懒加载,免得把 prompt 撑爆。运行时层只管调度和校验,不含模型智能,骨干可以热插拔。harness 和评测环境紧耦合:工具调用直接打到 PIT 沙箱的 FAISS,rubric judge 同时充当训练奖励。奖励里 rubric 评分占 0.6、对报告连贯性和轨迹质量的 LLM 判分占 0.4,用 GRPO 做强化训练。
17 个基线在 FinanceGym 上跑一遍(归一化 rubric 均值,%):
| 系统 | 整体 | 截止前 | 截止后 |
| Claude-Opus-4.7 | 34.1 | 50.1 | 9.9 |
| Gemini-3.1-Pro | 33.2 | 46.8 | 12.8 |
| FinanceHarness(27B 开源) | 32.4 | 45.7 | 11.8 |
| GPT-5.5 | 31.8 | 47.5 | 8.0 |
| Tongyi-DR(微调) | 28.2 | 39.7 | 10.7 |
几个读法。第一,没有一个系统整体过 40%,离专家 82% 的通过率差一大截,头部空间巨大。第二也是最关键的:pre-cutoff 普遍在 40-50 分,post-cutoff 全线掉到 8-13 分,这种悬殊在所有系统上稳定存在。因为大家用的是同一个 PIT 语料,这个 gap 反映的是基准本身的核心难度,与检索设置无关。分析已知历史这些 agent 还行,预测未来几乎全军覆没。
第三是 FinanceHarness 的性价比。固定骨干(Qwen3.6-27B)的消融:裸模型加搜索 25.3%、朴素 harness 29.6%、完整 harness 32.4%、再上 GRPO 训练 32.8%。可见 harness 这层脚手架把同一个 27B 模型抬了 7.1 分(相对约 +28%),而 RL 训练只多挤了 0.4 分。一个 27B 开源 harness 因此超过所有开源模型、略胜最强的 agentic search 系统,只输给两个闭源大模型。作者还指出,在固定脚手架下换骨干带来的差距,比在固定骨干下换脚手架更大:当前金融深度研究仍被底层模型卡着。
对做 agent 和 deep research 产品的人来说,这篇的价值有两块。一块是 FinanceGym 这个时间点隔离的评测范式:做任何预测类 agent 评测,先想清楚怎么切断未来信息,否则分数不可信。另一块是工程信号:scaffolding(脚手架)比 RL 训练回报高得多,分层工具接口让一个中等规模开源模型逼近闭源旗舰。
最大的清醒剂是那张 pre/post gap:别信 deep research agent 能「预测」,它们在分析历史上体面,在赌未来上接近瞎猜。
作者自己列了两条。语料只覆盖 2025 年的英文网页,非英文、付费专业数据、结构化申报文件都有限;专门微调的 deep research 模型被放到自建语料上跑,属于分布外迁移,分数得当迁移结果读。
另一处存疑:harness 和评测环境紧耦合(工具直打沙箱 FAISS、rubric judge 同时当奖励),基准又是作者自建自评的,FinanceHarness 在自家场地上占便宜是结构性风险,跨到真实金融研究环境的迁移没有被验证。GRPO 训练只动了 172 条机器标注样本、增益 0.4 分,这个 RL 部分几乎是装饰性的。