COLM 2026:DeepScholar-Bench 评测 AI 生成的研究综述质量
mrdrozdov · x · 2026-10-09
作者 Negar Empr 在 COLM 2026 展示 DeepScholar-Bench,一个用于评估 AI 生成研究综述(research synthesis)质量的基准,现场海报在 Imperial Ballroom #72。作者本周还带来另一篇关于多智能体 Transactive Memory 与 Lifelong Agents 的论文,并表示乐于交流搜索智能体与 deep research 系统。
「研究」频道最新
- Agent Plasticity 论文正式发布:作者阵容含 Rob Fergus、Sanjeev Arora 等大咖 — anirudhg9119 · 2026-10-09
- Agent Plasticity 论文连载:Claude 在 NetHack 中学会把祈祷改成可复用规则 — anirudhg9119 · 2026-10-09
- 新指标 Agent Plasticity:GPT-5.6 Sol 学习效率约为 Claude Fable 5 的 5 倍 — anirudhg9119 · 2026-10-09
- 为什么有的智能体难提升?四个模型复用率 94-98% 收益却大相径庭 — anirudhg9119 · 2026-10-09
- OpenAI 疑以时间预算而非 token 预算编排多智能体集群,并视之为敏感 IP — maksym_andr · 2026-10-09
- OpenAI Quasi-Riemann 震动数学界:百位数学家披露集体反应 — littmath · 2026-10-09