Meta 的 GAMUT 基准显示模型仍常漏掉关键信息
dair_ai · x · 2026-07-22
Meta 提出 GAMUT,专门评估答案“是否说全了”
Meta 研究团队发布了 GAMUT,它不只看回答对不对,而是进一步检查回答有没有覆盖完整。
核心方法
- 提出一个 两层 meta-rubric:先表示结构、重要性、开放集合、顺序流程和事实关系,再机械展开成一份平铺的二元检查清单。
- 这样做的目标是让 LLM judge 能更稳定地评分,尤其适用于长文本生成任务。
- 论文认为,传统事实核查偏重“精度”,却常常忽视“覆盖度”这一半的事实质量。
基准设置
- 共 1,813 个问题,来自真实可穿戴图像场景。
- 覆盖 10 个领域。
- 每题都有专家验证过的 rubric。
- 另外还发布了一个纯文本版本。
结果
在 14 个前沿与开源模型 上,最好成绩只有 58.7%。
作者表示,这个基准确实很难,而且换不同 judge 模型,结果依然比较稳定。
论文结论
他们认为,用户真正失败的地方往往不是“答错”,而是“漏答”。这套 rubric 编译方法也可能迁移到其他需要层级约束的任务里。
所属事件:Meta 发布 GAMUT 基准评估生成长文本完整性(2 条相关)→
「研究」频道最新
- 研究者争论这次模型失效是否真是对齐问题 — dhadfieldmenell · 2026-07-22
- 研究者押注后训练阶段的离策略强化学习 — andersonbcdefg · 2026-07-22
- Atome LM 在 18 项 MCU 任务上持平或胜出,体积小 5 到 70 倍 — themoroccanship · 2026-07-22
- Helmholtz Munich 与 TUM 开放可信 AI 科学博士名额 — zeynepakata · 2026-07-22
- 论文把 AI 对齐定义为会移动的社会技术目标 — weballergy · 2026-07-22
- AI 编程工具让社会科学前瞻实验成本大降 — weballergy · 2026-07-22