Meta 发布 GAMUT 基准评估生成长文本完整性
Meta 研究团队正式发布了名为 GAMUT 的全新评估基准。与以往仅关注回答准确性的测试不同,GAMUT 专门面向开放式长文本生成,重点评估模型生成答案的“事实完整性”,即检查内容是否真正做到了要点全覆盖。该基准引入了两层 meta-rubric 评估框架,旨在解决现有模型在生成长篇大论时常遗漏关键信息的痛点。
2026-07-22 ~ 2026-07-22 · 2 条相关
- Meta 的 GAMUT 评测长答案是否完整,而不只是正确 — facebook · 2026-07-22
- Meta 的 GAMUT 基准显示模型仍常漏掉关键信息 — dair_ai · 2026-07-22