SciArena论文:科学家如何评估AI答案
allen_ai · x · 2026-07-16
SciArena 团队表示,NeurIPS 2025 Spotlight 论文会进一步解读:科学文献问答场景下,科学家如何评价 AI 生成答案。
他们强调,这项工作不只是看排行榜,还包含:
- 用于深度研究 agent 的真实科学问题数据集
- 专家偏好数据
- 经人工核验的反馈
团队也感谢贡献问题、投票和理由的研究者。
所属事件:SciArena 7月15日退役,o3 登顶科学问答榜(6 条相关)→
「模型」频道最新
- 为何 Google 等巨头迟迟不开源 STT 语音模型?用户更信本地部署 — techtotechbytechy · 2026-09-11
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11
- 不改模型给 Qwen3-8B 加近似层,预填充时间砍半 — teortaxesTex · 2026-09-11
- Schmidhuber?不,是 rschu:Pro 20x 套餐不到一天烧掉 60% 额度 — rschu · 2026-09-11
- Google Grounded Search 计费翻车:15000次请求仅289次计入免费额度 — ItalyExpat · 2026-09-11
- 网友热议 DeepSeek 新模型:K3 还是缩水版 K3-Flash? — teortaxesTex · 2026-09-11