Paperena 基准按完整科研周期评测 AI 科学家:写、审、改
yeewhye · x · 2026-09-24
SnorkelAI 在 Frontier Data Summit 上介绍了 Paperena——一个评测「AI 科学家」的基准,模拟真实科研循环:写论文、审稿、修改。
- 评测维度包括事实性、可复现性、新颖性和社区行为
- 来自 @haritv 和 Paperena AI 团队,是峰会 25+ 张海报之一
峰会本身也值得关注:一日邀请制,2026 年 10 月 8 日于旧金山,汇集一批新基准(STELLA-Bench、MedPAIR、CollusionBench、Terminal Bench 2.1 等),演讲者包括 François Chollet、Dawn Song、Sanmi Koyejo、Alex Ratner 等人,主题覆盖动态环境中的 agent 评测、长时程自主性与多产物复杂输出的评分。
「研究」频道最新
- 不用数字孪生:直接在非线性波硬件上训练物理系统 — bravo_abad · 2026-09-24
- Anthropic 官宣:Claude 在噬菌体 DNA 中发现未知酶系统 — nptacek · 2026-09-24
- 950 个 agent 跑 21 小时,酶的真实功能仍无定论 — ns123abc · 2026-09-24
- ICLR 2027 抢在 NeurIPS 2026 结果公布前开放审稿竞标引争议 — rao2z · 2026-09-24
- 放弃重度提示脚手架,前沿模型评测改用统一标准化 scaffold — gleech · 2026-09-24
- 耐热真核生物纪录刷新至 63°C,研究主要靠 RNA 测序加 AlphaFold2 完成 — NikoMcCarty · 2026-09-24