AA-Omniscience 基准:42 主题 6000 道事实题,最强模型也有约 1/4 答错
randal_olson · x · 2026-09-30
Randall Olson 公布 Artificial Analysis 的 AA-Omniscience 数据:涵盖 42 个工作领域的 6000 道具体事实题,模型在不开启搜索的情况下作答,统计错误答案占已回答题目的比例(拒绝作答不计入)。
结论:即便是最好的模型,无搜索状态下也有约四分之一的答案出错——重要事实必须让模型查证。
配套开源了 evident-charts:一个教 AI 编码代理(Claude Code、Codex、Cursor 等)画清晰诚实图表的 agent skill,会先检查数据问题(合计混入分项、重复行、占位代码、初值月份等),并在图表展示前自动批评和重建不合格图表,如修正 log 轴上的原始计数、把混进排名的 EU 总计剔除、去掉无意义的彩虹配色。
所属事件:数据显示顶级AI模型不搜索时事实题答错率约四分之一(2 条相关)→
「模型」频道最新
- 用户吐槽:Opus 5.5用三天烧掉八成额度,弃用 — MaziyarPanahi · 2026-10-01
- Liquid AI 发布 LongevityBench:小型 LFM 在多项衰老任务胜过前沿模型 — JosephJacks_ · 2026-10-01
- GPT-6.1 Sol 实测:高效但偏慢,订阅方案变化引担忧 — kimmonismus · 2026-09-30
- GPT 6.1 Astra 超代码模式生成 three.js 海洋场景 — OpenAIDevs · 2026-09-30
- 分析称 OpenAI DOTS 意在用智能体收拾 ChatGPT 的产品乱局 — mark_k · 2026-09-30
- NaceAI 发布 Drex 1.5:小于 10B 参数登顶 Decision Index 决策榜 — nischay_twt · 2026-09-30