数据显示顶级AI模型不搜索时事实题答错率约四分之一
Randall Olson 基于 Artificial Analysis 的 AA-Omniscience 基准发布图表:该基准涵盖 42 个工作领域的 6000 道具体事实题,在不开启搜索的情况下,即使是顶级 AI 模型,回答此类问题也有约四分之一的答案出错。结论是涉及重要事实时,用户仍需谨慎核验模型输出,不能完全依赖模型记忆。
2026-09-30 ~ 2026-09-30 · 2 条相关
- Artificial Analysis 数据:顶级模型无搜索答事实题约 1/4 出错 — randal_olson · 2026-09-30
- AA-Omniscience 基准:42 主题 6000 道事实题,最强模型也有约 1/4 答错 — randal_olson · 2026-09-30