评测基准饱和失真,社区呼吁建真实搜索评测
Reddit 用户指出,当前主流大模型 benchmark 大多已经饱和,或在过于受限的条件下测试,例如 AA Omniscience 限制了工具访问,而现实中大量用户恰恰把聊天模型当作信息检索工具使用。深度研究与广域联网检索类评测严重缺位,社区呼吁建立真实环境下的搜索与事实检索基准,以反映模型的实际可用性。
2026-09-26 ~ 2026-09-26 · 2 条相关
- 现有评测饱和失真,网友呼吁建真实环境搜索与事实检索基准 — Lucky_Creme_5208 · 2026-09-26
- 深度研究与联网检索 benchmark 严重缺位,社区呼吁真实环境评测 — Lucky_Creme_5208 · 2026-09-26