Paperena 基准按完整科研周期评测 AI 科学家:写、审、改

yeewhye · x · 2026-09-24

SnorkelAI 在 Frontier Data Summit 上介绍了 Paperena——一个评测「AI 科学家」的基准,模拟真实科研循环:写论文、审稿、修改。

峰会本身也值得关注:一日邀请制,2026 年 10 月 8 日于旧金山,汇集一批新基准(STELLA-Bench、MedPAIR、CollusionBench、Terminal Bench 2.1 等),演讲者包括 François Chollet、Dawn Song、Sanmi Koyejo、Alex Ratner 等人,主题覆盖动态环境中的 agent 评测、长时程自主性与多产物复杂输出的评分。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →