微软发布 BI-Bench:前沿大模型商业智能准确率不足半数

微软研究院在 Hugging Face 发布 BI-Bench 基准与 BI-Agent,首次系统性评估 LLM 的端到端商业智能(BI)能力。基准数据来自公开渠道收集的真实 BI 项目,并从真实用户仪表盘中人工提取问答对构建。结果显示,前沿大模型在端到端 BI 任务上的准确率不足 50%,暴露出当前模型在真实业务分析场景中的明显短板。

2026-09-22 ~ 2026-09-22 · 2 条相关