Meta 的 GAMUT 基准显示模型仍常漏掉关键信息
dair_ai · x · 2026-07-22
Meta 提出 GAMUT,专门评估答案“是否说全了”
Meta 研究团队发布了 GAMUT,它不只看回答对不对,而是进一步检查回答有没有覆盖完整。
核心方法
- 提出一个 两层 meta-rubric:先表示结构、重要性、开放集合、顺序流程和事实关系,再机械展开成一份平铺的二元检查清单。
- 这样做的目标是让 LLM judge 能更稳定地评分,尤其适用于长文本生成任务。
- 论文认为,传统事实核查偏重“精度”,却常常忽视“覆盖度”这一半的事实质量。
基准设置
- 共 1,813 个问题,来自真实可穿戴图像场景。
- 覆盖 10 个领域。
- 每题都有专家验证过的 rubric。
- 另外还发布了一个纯文本版本。
结果
在 14 个前沿与开源模型 上,最好成绩只有 58.7%。
作者表示,这个基准确实很难,而且换不同 judge 模型,结果依然比较稳定。
论文结论
他们认为,用户真正失败的地方往往不是“答错”,而是“漏答”。这套 rubric 编译方法也可能迁移到其他需要层级约束的任务里。
所属事件:Meta 发布 GAMUT 基准评估生成长文本完整性(2 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27