Meta 发布 GAMUT 基准评估生成长文本完整性

Meta 研究团队正式发布了名为 GAMUT 的全新评估基准。与以往仅关注回答准确性的测试不同,GAMUT 专门面向开放式长文本生成,重点评估模型生成答案的“事实完整性”,即检查内容是否真正做到了要点全覆盖。该基准引入了两层 meta-rubric 评估框架,旨在解决现有模型在生成长篇大论时常遗漏关键信息的痛点。

2026-07-22 ~ 2026-07-22 · 2 条相关