数据显示顶级AI模型不搜索时事实题答错率约四分之一

Randall Olson 基于 Artificial Analysis 的 AA-Omniscience 基准发布图表:该基准涵盖 42 个工作领域的 6000 道具体事实题,在不开启搜索的情况下,即使是顶级 AI 模型,回答此类问题也有约四分之一的答案出错。结论是涉及重要事实时,用户仍需谨慎核验模型输出,不能完全依赖模型记忆。

2026-09-30 ~ 2026-09-30 · 2 条相关