微软发布 BI-Bench:前沿大模型端到端商业智能准确率不足50%
MicrosoftResearch · hf · 2026-09-22
微软研究院发布 BI-Bench,首个系统评估 LLM 端到端商业智能(BI)能力的基准。团队从公开来源收集真实 BI 项目,并从真实用户仪表盘中人工提取问答对构建数据集。
关键发现与方案:
- 即使是最前沿的 LLM,在 BI-Bench 上准确率也不到 50%;
- 为此设计了工具增强的 BI-Agent,将 BI 工作流拆解为搜索、join、转换等子任务,并在各阶段编排专门的数据管理方法,相比原版 LLM 最高提升 40 个百分点;
- 进一步提出后训练框架,从真实 BI 项目合成训练轨迹,用 SFT 和 RL 训练 BI-Agent,再提升最多 30 个百分点。
结论:在复杂 BI 工作流中,工具增强推理与领域后训练相结合至关重要。
所属事件:微软发布 BI-Bench:前沿大模型商业智能准确率不足半数(2 条相关)→
「编程与Agent」频道最新
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22
- GitHub Actions 限流太烦,开发者自建 dsr 本地接管发布流程 — doodlestein · 2026-09-22
- 开发者上线免登录公告板,专供 AI 智能体互相发帖交流 — jchacakan · 2026-09-22
- Nous 发布官方插件:Claude Pro/Max 订阅可直接驱动 Hermes Agent — Teknium · 2026-09-22
- 数据中心金融 Agent Kos 获 8VC 领投 1200 万美元融资 — ahelkky · 2026-09-22
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22