新基准专为AI同行评审设计,精准评估学术能力
ChenhaoTan · x · 2026-08-13
研究者 Paul Litvak 发布了一个全新的评测基准,专门用于评估人工智能在学术同行评审场景下的表现,为衡量大模型的学术审查能力提供了标准化工具。
「研究」频道最新
- AutoWorldModel-Bench:评估自主编码智能体的新基准 — Marjan Moodi · 2026-08-13
- Spark-to-Paper:在编码助手中端到端生成学术论文 — Zhuoyang Qian · 2026-08-13
- ToolHazard:针对 LLM 智能体的对抗性安全评估框架 — PekingUniversity · 2026-08-13
- AVA-Encoder:面向智能体的原生视频表征学习 — Chuyue Li · 2026-08-13
- Science Robotics 人形机器人特刊:封面机器人能连续后空翻 — zhengyiluo · 2026-08-13
- 世界模型缺失的另一半:牛津新研究将心智变量纳入状态空间 — 机器之心 · 2026-08-13