Artificial Analysis 发布 AA-Omniscience:仅 3 个模型不比瞎猜更易幻觉

geoffwolfe · x · 2026-09-23

Artificial Analysis 发布新基准 AA-Omniscience,衡量模型的知识储备与幻觉倾向,覆盖 6 大领域、42 个主题共 6000 道题。计分规则:答对 +1、答错 -1、弃答 0,把「不确定性管理」纳入评测本身而非漏洞——纠正了以往主要评测数据集答错不扣分、变相鼓励模型每题都猜的设计缺陷。结论相当扎眼:除 3 个模型外,其余所有模型在难题上都更倾向于幻觉作答而非给出正确答案。

该基准将与 Artificial Analysis Intelligence Index 互补,共同刻画模型能力。文章还举例说明嵌入知识的重要性:模型应知道 MCP 指 Model Context Protocol 而非 Multi Client Persistence,才知道该不该联网搜索。ReasonCore 表示已将 AA-Omniscience 风格任务用于训练数据,共同提升事实可靠性、校准弃答与领域知识。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →