FINSKILLOPS: A Self-Evolving Multi-Agent System for SEC Filing QA
Yanzhang Ma, Zhenghan Tai, Hanwei Wu, Sizhe Guan, Jianliang Lei, Hailin He, Chaolong Jiang, Jijun Chi, Tung Sum Thomas Kwok, Bohuai Xiao, Jingrui Tian, Xinlu Wu, Xingao Zhan, Peng Lu, Muzhi Li, Yihong Wu, Liheng Ma, Sicheng Lyu, Tianshuo Yan, Junhao Zhu, Yaqian Xu, Lei Ding, Yufei Cui, Ziquan Liu, Boyu Han, Hengli Liu, Ling Zhou, Xinyu Wang
cs.AI, cs.IR, cs.MA, cs.SE
2026-09-17
FinSkillOps把SEC问答失败做成带适用范围和回归门的技能补丁,增强集正确率从3.70升到4.55;十二轮只放行六个技能,监控非正确率从20.0%降到12.5%。
金融问答系统通常在上线前把检索、提示词、多智能体协作调完,上线后行为就冻住。SEC年报问答却会反复踩同一类坑:把FY2026的出口管制写进FY2025、把母公司和子公司数字混在一起、表格引用对了份额却算错。
现有自我改进方法能把失败轨迹变成新行为,但管不住补丁该作用在哪、会不会把已经答对的题打坏。这篇把上线后的可靠性维护定义成受控的技能运维:反复出现的失败要变成带适用范围的自然语言技能补丁,补丁必须通过针对性验证、受保护用例回归、负对照,才能进入生产快照。
FinSkillOps分两条路。在线服务把SEC文件切成带模态标签的检索单元(叙事、表格渲染、章节摘要),编排器按问题激活五类分析师角色(综合、量化、市场、法律、公司),走稀疏、稠密、摘要三条检索路径,再合成答案。技能只在两个注入点进提示词:查询拆解约束检索,最终合成约束声称。
离线进化环把失败答案对照检索到的申报文件分两阶段诊断。第一阶段读问题、失败答案、judge反馈和检索上下文,提出解释并生成grep计划;确定性grep跑完后,第二阶段对照命中片段给出错误类型、证据和建议(propose / park / do-not-fix)。某类错误够频才起草技能。一条技能带适用条件、行为文本、排除案例、注入点和假触发守卫。
晋升要同时满足三件事:目标验证集上Correct比例上升、受保护集上原Correct不能掉、声明的负对照上零假触发。通过的进入带版本号的注册表,旧版可被替换或退休。服务时用冻结快照,不在线改技能。服务端用DeepSeek-V3.2,基准评分用Qwen3-Max。
同一份冻结注册表在六套基准上同时拿到最高的判决加权正确率(W-Corr.,0–5,Correct=5 / Partial=3 / Incorrect=1 / Failure=0)和参考一致性。增强内部集114题(Zeekr 84、Lotus 20、NVIDIA 10)上,从多智能体初值3.70升到4.55;Zeekr从3.46到4.52。公开集增益更小:FinanceBench 3.49对FinGPT的3.35,FinDER 2.88对初值2.68。
| 设置 | 增强内部集 | FinanceBench | FinDER | 受保护回归 |
| 完整系统 | 4.55 | 3.49 | 2.88 | 0 |
| 去掉技能进化 | 3.70 | 3.15 | 2.68 | 0 |
| 去掉保护门 | 4.32 | 3.38 | 2.79 | 3 |
| 去掉失败分类 | 4.08 | 3.28 | 2.70 | 0 |
去掉保护门在目标集上ΔAcc更大(+0.78对完整系统的+0.62),但受保护集出现3次回归。拆掉「期间对齐」技能,内部集掉到4.21,是单技能里最大的坑。和改过接口的AutoSkill、SkillOpt比,四套基准等权平均W-Corr.分别是2.00、2.66、初值3.22、FinSkillOps 3.66;前两者相对初值全负,FinSkillOps四套都赢。
十二轮运维实验把进化300题、保护120题、监控200题互不重叠。进化集非正确率从30.0%降到18.3%,监控集从20.0%降到12.5%。33个候选只放行6个,5个因保护集失败(暴露7次回归)。注册表从第5轮到第12轮只留4条活跃技能,静态技能文本从421缩到347 token。FinanceBench和SECQUE上各跑6轮,监控W-Corr.分别提高0.40和0.25。
对要上线金融Agent的人,这篇把「让Agent自己长技能」从加prompt变成带回归测试的发布流程。门很严:33个候选里27个被拒、推迟或撤回。这不是炫进化速度,是承认自然语言补丁会误触发、会把简单题拆过头。被挡下的例子包括禁止跨行汇总的Table Row Lock,以及把简单问题拆过头、带偏检索的Multi-Hop Decomposition。
能直接搬的是三件套:失败要打类型并对照原文、晋升要有受保护集和负对照、注册表要版本化和冻结快照。公开基准上的增益不大,内部增强集才拉开差距,说明这套方法吃的是期间、实体、计算这类反复错,不是通用阅读理解。技能文本只是输入token的一小部分,服务成本接近MoA、低于FinDebate,大约是FinSage的四倍。
证据只覆盖SEC问答。十二轮实验同时改了路由和诊断,监控集每轮都评,测的是部署轨迹,不是技能文本的独立因果,也不能当盲测泛化。候选产物、准入日志、划分清单不完整,门控决策和题目是否泄漏不好核。财务专家审核通道没人值班,准入只靠自动检查;judge一致性用的是作者组标注员,四路判决κ=.820/.675。公开集上FinGPT在FinanceBench四项质量维领先,FinSkillOps在FinDER清晰度并列最低。保守门会拖慢适应。