AI 科学家有了新标尺:从“考试”转向真实发现闭环
量子位 · wechat · 2026-08-24
由深度原理、微软、斯坦福等机构联合发布的论文《Measuring AI Scientists: From Exams to Discovery》,提出了“发现回合(discovery episode)”评估体系,改变了以往仅靠 HLE 闭卷考试衡量 AI 科研能力的模式。新体系全程记录 AI 在“假设→设计实验→执行验证→迭代优化”全周期的决策轨迹,重点考核实验结果的科学性与真实性,并将失败数据视为核心资产。作为该体系的应用样本,深度原理的 MIRA 平台在 ResearchClawBenchmark 和 ScienceAgentArena 评测中均位列第一,展示了跨干湿实验室的闭环科研能力。
「研究」频道最新
- Anthropic 研究:微调测谎仪在分布外失效 — PandaAshwinee · 2026-08-24
- 生数科技朱军发布通用世界模型五级路线图 — 生数科技 · 2026-08-24
- AGI 或率先诞生于硬科技:因数学与代码有明确反馈 — imjustnewatai · 2026-08-24
- 150 美元从零训练 15.7 亿参数 Dreamer 4 — OtherRaisin3426 · 2026-08-24
- 图工程协调多智能体系统,实现复杂任务管理 — Yuyuan Feng · 2026-08-24
- RecVerse 智能体模拟真实电商购物会话 — Jiakai Tang · 2026-08-24