Meta 新基准 GAMUT 专测长答案遗漏,最好模型仅 58.7%

rohanpaul_ai · x · 2026-07-24

Meta 提出 GAMUT:把“漏答了什么”也纳入事实性评估

这篇 Meta 新论文的核心观点是:事实性不只是“别说错”,还要“把该说的说全”。长答案里真正难测的,往往不是错误,而是遗漏。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →