Qwen 团队提出 FinIndices 评测:揭示大模型金融推理存在严重瓶颈
Qwen · hf · 2026-08-05
Qwen 团队发布大规模评测基准 FinIndices,用于测试大语言模型在未裁剪的长篇财务报表(长达 32K tokens)上的数据处理与推理保真度。
测试发现了大模型的两个严重缺陷:
- 知识瓶颈:即使预训练时记住了公式,模型依然依赖脆弱的模式匹配。一旦移除公式提示,表现就会大幅暴跌(例如 Gemini 在表格任务上从 70.70% 骤降至 38.22%)。
- 结构瓶颈:在生成多指标、多周期表格的高认知负荷下,原本能完美执行单步推导的模型会退化为使用浅层启发式方法(如抓取错误的相邻列或进行懒惰的字面算术)。
研究表明,通过监督微调(SFT)可以部分恢复模型的结构化逻辑能力,在无提示场景下取得了显著提升。
「模型」频道最新
- LiquidAI 发布 LFM2.5-2.6B 轻量模型 GGUF 版 — LiquidAI · 2026-08-05
- 字节跳动发布 SeedRealtime 全双工音视频大模型 — testingcatalog · 2026-08-05
- 别神化未发布模型,GPT Image 2已具备高质量出图能力 — Angaisb_ · 2026-08-05
- Qwen 团队 AMA 透露:3.8 版本达 2.4T 参数,即将发布 27B 新模型 — pmttyji · 2026-08-05
- ChatGPT 竟主动爆粗口,用户实测规划退休时遭意外回复 — Zikkan1 · 2026-08-05
- 网友吐槽 Claude Opus 回复过于直白无废话 — CtrlAltDwayne · 2026-08-05