Qwen 团队提出 FinIndices 评测:揭示大模型金融推理存在严重瓶颈

Qwen · hf · 2026-08-05

Qwen 团队发布大规模评测基准 FinIndices,用于测试大语言模型在未裁剪的长篇财务报表(长达 32K tokens)上的数据处理与推理保真度。

测试发现了大模型的两个严重缺陷:

研究表明,通过监督微调(SFT)可以部分恢复模型的结构化逻辑能力,在无提示场景下取得了显著提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →