GBAG-Bench 发现本地 BI 模型会写对 SQL 也会瞎报增长
Additional_Menu8542 · reddit · 2026-07-28
一位本地 BI 工具作者开源了 GBAG-Bench(Grounded BI Answer Generation),想补上一个很多 SQL 评测都忽略的缺口:SQL 写对了之后,模型把结果转成自然语言时,是否还忠实。
- 作者让本地模型分析 136 个月销售数据,SQL 本身是对的,但模型却把结果总结成 “增长 48%”,而业务实际上十年都几乎持平。
- 这个 benchmark 采用 MIT 许可,包含 35 道题,覆盖 Sakila、Chinook、Northwind。
- 它不只看 SQL 对不对,还评估 faithfulness(忠实度)、completeness(完整性) 和 insight(洞察)。
- 作者的一个核心判断是:问题更像是 聚合能力缺失,而不是理解缺失;把聚合结果先算好再注入上下文,会明显改善输出。
- 但二次评审也显示,部分提升受评审模型严厉程度影响,完整性提升更稳,忠实度提升没那么稳。
「研究」频道最新
- 固定分数看开销:比较 agent 达到同一成绩要花多少钱 — soumitrashukla9 · 2026-07-28
- 九种评估 agent 能力的方法:先看固定开销下的分数 — soumitrashukla9 · 2026-07-28
- 斯坦福学者反思:为何人脑学数学效率远超AI? — SuryaGanguli · 2026-07-28
- Cohere Labs 在 Twitch 推出 transformers 与 NLP 讲座 — nickfrosst · 2026-07-28
- 论文作者将 AI 书市场稀释与 Kadrey v. Meta 版权案关联起来 — TuhinChakr · 2026-07-28
- 论文称成功的 AI 图书更爱复用已出版作品中的稀有短语 — TuhinChakr · 2026-07-28