FinanceComplexQA 发布 2026 题金融文档推理基准
Beihang · hf · 2026-07-24
FinanceComplexQA:面向金融文档的 agent 推理基准
这项工作提出了 FinanceComplexQA,用于评测 agent 在工业级金融文档上的开放式推理能力。
作者先设计了一个叫 Finance-LaTeX SKILL 的技能,用来根据专家知识合成版式复杂的金融文档;再基于这个技能构建 agent 工作流,生成了 2,000 份专业金融文档和 6,000 组问答对。基准本身包含 2,026 个深度研究任务,覆盖 1,009 份金融文档,支持中英双语,横跨 6 类主流场景和 7 类任务。
评测采用 Agent-as-a-Judge 和多种指标,重点考察数值计算、多跳推理、内容总结和行业分析。论文还系统分析了领先的 RAG 系统 与 agentic reasoning 工具在这些真实复杂文档上的失败模式,指出当前系统在可靠性和复杂推理上仍有明显短板。
「编程与Agent」频道最新
- 开发者重构 Claude Code 工厂:规划、实现、审查三段式 — blaizedsouza · 2026-07-24
- 默认 Codex CLI 跑出 XBOW 92.3%,引发基准失真讨论 — moyix · 2026-07-24
- Sebastian Raschka 将聊 DeepSeek-V4 和开源编码智能体 — hugobowne · 2026-07-24
- Antigravity CLI 1.1.6 让自定义 agent 变成 Markdown — rseroter · 2026-07-24
- 微软研究院用 ReOPD 离线蒸馏多轮智能体 — MicrosoftResearch · 2026-07-24
- Compound Engineering 3.20 把编程拆给多模型协作 — danshipper · 2026-07-24