评测基准饱和失真,社区呼吁建真实搜索评测

Reddit 用户指出,当前主流大模型 benchmark 大多已经饱和,或在过于受限的条件下测试,例如 AA Omniscience 限制了工具访问,而现实中大量用户恰恰把聊天模型当作信息检索工具使用。深度研究与广域联网检索类评测严重缺位,社区呼吁建立真实环境下的搜索与事实检索基准,以反映模型的实际可用性。

2026-09-26 ~ 2026-09-26 · 2 条相关