Meta 的 GAMUT 基准显示模型仍常漏掉关键信息
dair_ai · x · 2026-07-22
Meta 提出 GAMUT,专门评估答案“是否说全了”
Meta 研究团队发布了 GAMUT,它不只看回答对不对,而是进一步检查回答有没有覆盖完整。
核心方法
- 提出一个 两层 meta-rubric:先表示结构、重要性、开放集合、顺序流程和事实关系,再机械展开成一份平铺的二元检查清单。
- 这样做的目标是让 LLM judge 能更稳定地评分,尤其适用于长文本生成任务。
- 论文认为,传统事实核查偏重“精度”,却常常忽视“覆盖度”这一半的事实质量。
基准设置
- 共 1,813 个问题,来自真实可穿戴图像场景。
- 覆盖 10 个领域。
- 每题都有专家验证过的 rubric。
- 另外还发布了一个纯文本版本。
结果
在 14 个前沿与开源模型 上,最好成绩只有 58.7%。
作者表示,这个基准确实很难,而且换不同 judge 模型,结果依然比较稳定。
论文结论
他们认为,用户真正失败的地方往往不是“答错”,而是“漏答”。这套 rubric 编译方法也可能迁移到其他需要层级约束的任务里。
所属事件:Meta 发布 GAMUT 基准评估生成长文本完整性(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11