Meta 的 GAMUT 基准显示模型仍常漏掉关键信息
dair_ai · x · 2026-07-22
Meta 提出 GAMUT,专门评估答案“是否说全了”
Meta 研究团队发布了 GAMUT,它不只看回答对不对,而是进一步检查回答有没有覆盖完整。
核心方法
- 提出一个 两层 meta-rubric:先表示结构、重要性、开放集合、顺序流程和事实关系,再机械展开成一份平铺的二元检查清单。
- 这样做的目标是让 LLM judge 能更稳定地评分,尤其适用于长文本生成任务。
- 论文认为,传统事实核查偏重“精度”,却常常忽视“覆盖度”这一半的事实质量。
基准设置
- 共 1,813 个问题,来自真实可穿戴图像场景。
- 覆盖 10 个领域。
- 每题都有专家验证过的 rubric。
- 另外还发布了一个纯文本版本。
结果
在 14 个前沿与开源模型 上,最好成绩只有 58.7%。
作者表示,这个基准确实很难,而且换不同 judge 模型,结果依然比较稳定。
论文结论
他们认为,用户真正失败的地方往往不是“答错”,而是“漏答”。这套 rubric 编译方法也可能迁移到其他需要层级约束的任务里。
所属事件:Meta 发布 GAMUT 基准评估生成长文本完整性(2 条相关)→
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11