新发布的搜索任务资源覆盖固定答案与长报告评测
hhsun1 · x · 2026-07-24
这条帖子转发了一组面向搜索任务的评测资源,重点不是某个模型结果,而是如何系统地评估 search / deep research 场景。
资源覆盖的任务类型
- 固定答案类查询
- 答案会随时间变化的查询
- 多维约束条件查询
- 长篇报告生成
作者特别提到这些资源配有 rubric trees,可以用来覆盖更广泛的 deep research 问题,并帮助做更细粒度的评测与对比。
「研究」频道最新
- GitHub 测试显示 AGENTS.md 能显著改变编码代理结果 — film_girl · 2026-07-24
- Robocurve 发布机器人真实世界基准与开源 Inspect Robots — ycombinator · 2026-07-24
- GEPA 团队发布 omni,将多种 LLM 优化器组合起来 — iamrobotbear · 2026-07-24
- Adhiraj Ghosh 讲任务自适应采样,预训练算力倍率达 3.33 倍 — pratyushmaini · 2026-07-24
- Science 研究用 transformer 解析阿尔茨海默病单细胞 3D 基因组重组 — jmuiuc · 2026-07-24
- 用 3D blocking 先控住镜头,再交给 Seedance 2.0 渲染视频 — andrew_n_carr · 2026-07-24