Meta 的 GAMUT 基准显示模型仍常漏掉关键信息

dair_ai · x · 2026-07-22

Meta 提出 GAMUT,专门评估答案“是否说全了”

Meta 研究团队发布了 GAMUT,它不只看回答对不对,而是进一步检查回答有没有覆盖完整。

核心方法

基准设置

结果

在 14 个前沿与开源模型 上,最好成绩只有 58.7%。

作者表示,这个基准确实很难,而且换不同 judge 模型,结果依然比较稳定。

论文结论

他们认为,用户真正失败的地方往往不是“答错”,而是“漏答”。这套 rubric 编译方法也可能迁移到其他需要层级约束的任务里。

所属事件:Meta 发布 GAMUT 基准评估生成长文本完整性(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →