Artificial Analysis 发布 AA-Omniscience:仅 3 个模型不比瞎猜更易幻觉
geoffwolfe · x · 2026-09-23
Artificial Analysis 发布新基准 AA-Omniscience,衡量模型的知识储备与幻觉倾向,覆盖 6 大领域、42 个主题共 6000 道题。计分规则:答对 +1、答错 -1、弃答 0,把「不确定性管理」纳入评测本身而非漏洞——纠正了以往主要评测数据集答错不扣分、变相鼓励模型每题都猜的设计缺陷。结论相当扎眼:除 3 个模型外,其余所有模型在难题上都更倾向于幻觉作答而非给出正确答案。
该基准将与 Artificial Analysis Intelligence Index 互补,共同刻画模型能力。文章还举例说明嵌入知识的重要性:模型应知道 MCP 指 Model Context Protocol 而非 Multi Client Persistence,才知道该不该联网搜索。ReasonCore 表示已将 AA-Omniscience 风格任务用于训练数据,共同提升事实可靠性、校准弃答与领域知识。
「模型」频道最新
- 观点:十年前的专家看到今天模型会宣称 AGI 已实现 — JacksonKernion · 2026-09-23
- 为省额度折腾模型切换:Reddit 用户称便宜 swarm 模型组合效果不错 — AnotherWallace · 2026-09-23
- 用户吐槽 Anthropic 新模型:自动路由到 fable、仍锁定 cyber — BLUECOW009 · 2026-09-23
- 爆料:Qwen4-35B-A3B 已在测试,尚未官宣 — AIFlow_ML · 2026-09-23
- 网传 Opus 5.5 系内部教师模型蒸馏产物,甚至称「首个 RSI 训练模型」 — ivan_bezdomny · 2026-09-23
- Hamel Husain 实测:用 Opus 5.5 测试 AI 写作是否告别「slop」 — HamelHusain · 2026-09-23