现有评测饱和失真,网友呼吁建真实环境搜索与事实检索基准

Lucky_Creme_5208 · reddit · 2026-09-26

一位 Reddit 用户指出,主流 benchmark 大多已饱和或测试条件过于受限,例如 AA Omniscience 限制了工具访问,而现实中大量用户恰恰把聊天模型用于信息检索、深度研究和广泛信息收集。

帖子反映社区对「实验室成绩与真实信息检索能力脱节」的普遍不满。

所属事件:评测基准饱和失真,社区呼吁建真实搜索评测(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →