金融原生 27B 智能体 RFC 准确率 98.33,成本约两成

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

cs.CL, cs.LG

2026-08-17

Mint-Agent 用可追溯数据和证据账本训练金融原生智能体,结论可回放核验。27B 的 Mint-Ag 在 RFC-Bench 拿到 98.33、FinanceAgentBench 76%,单题成本约为 GPT-5.6-Sol 的两成。

这篇在解决什么

金融智能体不能只背术语。它要在有出处的证据上做精确运算,还要撑住长程调研,并且每条结论能回放。现成智能体常在半路上断链:源相关但不权威、财年读错、单位混用。没有从源到计算到结论的可恢复路径,结果就不可信、也修不好。华东师大上海金融与 AI 学院和 Mint 团队把这条契约做成数据、harness 和算法三件套。

方法

数据引擎分两路。原子任务覆盖知识、抽取、计算、分析、核验,源来自 EDGAR、XBRL、交易所和 FRED,每条事实带定位器,推导必须可重放且答案唯一。长程任务只给研究目标,隐藏证据图,智能体必须自己搜、查、算、综合;图在生成时就固定,供事后核验。MintHarness 把证据账本和工作记忆放在模型上下文之外,工具结果蒸馏成带出处的记录,提交时用隔离评估器对照隐藏参考答案。训练先分叉:推理专家在原子任务上 SFT 再 RLVR(GSPO),执行专家在长程轨迹上 SFT、关键步 on-policy distillation,再对整条轨迹 RLVR。两边用 TIES 合并,再用按任务来源路由的多教师 OPD 收成一个策略:原子题走推理教师,长程交互走执行教师,避免两个专家在同一条样本上互相抢信号。底座是 Qwen3.5-9B(Mint-Cu)和 Qwen3.6-27B(Mint-Ag)。

结果

七项专业基准上 Mint-Ag 全部最高。RFC-Bench 98.33%,高于 Claude Opus 4.8 的 95.33 和 GPT-5.6-Sol 的 94.67。FinanceAgentBench v1.1 76.00%、v2 60.49%,后者比 GPT-5.6-Sol 高 3.70 分。FinSearchComp T2 89.04%,高于 Cursor(Grok 4.5)的 81.74。9B 的 Mint-Cu 在 T2 拿到 69.86%,超过 Agents-A1-35B 的 47.03。成本上 Mint-Ag 的 v2 均价 0.213 美元,GPT-5.6-Sol 为 0.959 美元,大约是其 22%。FinanceAgentBench 公开集很小:v1.1 50 题、v2 27 题。失败分析里,Cu 在 v1.1 主残差是漏答(18%),v2 主残差变成证据抽取(18.5%)。TIES 合并后四项分数不稳,多教师 OPD 再把 9B 拉回到 Cu 的最终分。

模型RFC-BenchFAB v1.1FinSearchComp T2
GPT-5.6-Sol94.6766.0041.10
Claude Opus 4.895.3366.0045.66
Mint-Cu 9B96.6768.0069.86
Mint-Ag 27B98.3376.0089.04

为什么重要

金融垂直智能体常被做成「领域语料微调 + 通用工具脚手架」。这篇把出处、可重放计算和审计轨迹当成同一条正确性契约,贯穿造题、执行和 RL 奖励。27B 在可靠性和长程执行上压过更大的通用模型,9B 已经够用搜索型任务,对要自建金融调研栈的团队是可对照的全栈配方。代价是评测面很窄,公开 agent 集只有几十题。

局限与存疑

FinanceAgentBench 用的是公开 50+27 题,作者联系维护方要额外划分未果,过拟合风险写在明面上。原子推理是单轮,长程才走 harness,和真实多工具混用仍有缝。成本按 Qwen 基座价折算本地 token,不是市场上的 Mint API 价。RFC 只评 Task 2。没有独立第三方复现。失败从漏答转到证据抽取,说明更难的研究题还卡在把检索结果变成口径正确的金融证据。

术语

原文与代码

社区讨论

相关论文

全部论文解读