现有评测饱和失真,网友呼吁建真实环境搜索与事实检索基准
Lucky_Creme_5208 · reddit · 2026-09-26
一位 Reddit 用户指出,主流 benchmark 大多已饱和或测试条件过于受限,例如 AA Omniscience 限制了工具访问,而现实中大量用户恰恰把聊天模型用于信息检索、深度研究和广泛信息收集。
- 已有少量检索类 benchmark(如图片中列出的),但都没有官方 leaderboard,且多年未更新
- 作者呼吁建立「真实环境」评测:允许联网搜索、开放工具访问、并在真实 harness(如 Claude、ChatGPT 等)下运行,不加人为限制
- 征集是否已有符合此标准的基准存在
帖子反映社区对「实验室成绩与真实信息检索能力脱节」的普遍不满。
所属事件:评测基准饱和失真,社区呼吁建真实搜索评测(2 条相关)→
「研究」频道最新
- AI 评审同行论文引争议,研究者集齐 7 篇关键论文回击 — sethlazar · 2026-09-27
- Rufus-Air 论文:按奖励可靠性排序 post-training 阶段炼出开源模型 — burny_tech · 2026-09-27
- 教 LLM 判断定理有趣度,AI 自主数学发现效率提升 4.3 倍 — burny_tech · 2026-09-27
- DeepMind 发布 AGI 经济政策框架:评估 11 种干预措施 — CurieuxExplorer · 2026-09-27
- Contrastive World Models:不用像素预测、纯潜空间学世界模型 — burny_tech · 2026-09-27
- AI 攻克百道数学难题后,数学家 Litt 长文回应:这是起点不是终点 — 机器之心 · 2026-09-27