深度研究与联网检索 benchmark 严重缺位,社区呼吁真实环境评测
Lucky_Creme_5208 · reddit · 2026-09-26
- Reddit 用户指出:当前几乎所有 benchmark 要么已饱和,要么在严格受限条件下测试,例如 AA Omniscience 限制了工具访问。
- 深度研究、广域联网检索、事实查证正是用户最常用的 chatbot 场景,但相关 benchmark 极少,且现有少数几个没有官方排行榜、多年未更新(帖内附有截图列表)。
- 作者呼吁建立一个在真实环境下评测的 benchmark:开放工具使用与联网搜索、使用真实 harness(如 Claude、ChatGPT Work 等产品形态),并向社区求证是否已有此类基准。
所属事件:评测基准饱和失真,社区呼吁建真实搜索评测(2 条相关)→
「研究」频道最新
- 函数梯度下降算法难题被攻克,论文入选 NeurIPS — CatAstro_Piyush · 2026-09-27
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- kalomaze 提想:把 nanogpt 训练技巧搬到 DCT 系数上检验普适性 — kalomaze · 2026-09-27
- 本月长寿速览:AI 设计药物让 6 项衰老指标变年轻 — rand_longevity · 2026-09-27
- 猜想:单义表示完美后可免外部验证器训练编程 Agent — menhguin · 2026-09-27
- 9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败 — Grimmoner · 2026-09-27