AA-Omniscience 基准:42 主题 6000 道事实题,最强模型也有约 1/4 答错

randal_olson · x · 2026-09-30

Randall Olson 公布 Artificial Analysis 的 AA-Omniscience 数据:涵盖 42 个工作领域的 6000 道具体事实题,模型在不开启搜索的情况下作答,统计错误答案占已回答题目的比例(拒绝作答不计入)。

结论:即便是最好的模型,无搜索状态下也有约四分之一的答案出错——重要事实必须让模型查证。

配套开源了 evident-charts:一个教 AI 编码代理(Claude Code、Codex、Cursor 等)画清晰诚实图表的 agent skill,会先检查数据问题(合计混入分项、重复行、占位代码、初值月份等),并在图表展示前自动批评和重建不合格图表,如修正 log 轴上的原始计数、把混进排名的 EU 总计剔除、去掉无意义的彩虹配色。

所属事件:数据显示顶级AI模型不搜索时事实题答错率约四分之一(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →