新基准 AutoResearchExam:给 AI 研究员 24 小时机器,实测 Agent 做科研的真实水平
AlexGDimakis · x · 2026-09-10
Alex Dimakis 团队发布 AutoResearchExam,一个针对开放式机器学习与工程任务的基准,覆盖模型训练、数据整理、AI 安全与可解释性等七个研究方向。
- 每个任务给 Agent 一台 CPU 或 GPU 机器、24 小时,通过实验和反馈迭代方案,用速度+质量的综合分计分
- 独特设计:检验 Agent 的改进能否在从未见过的数据上成立——发现研究型 Agent 在自我改进时经常过拟合
- 前沿对决:Astra 起步最强、领先约 19 小时,但 Fable 5.1 在最后几小时反超拿下第一
- Qwen3.8 Max、Gemini 3.8 Flash、Grok 4.6 处于性价比梯队
所属事件:AutoResearchExam 基准实测 24 小时自主科研智能体(4 条相关)→
「编程与Agent」频道最新
- 反向 .gitignore 思路:默认忽略全部文件,只显式放行需要的 — rseroter · 2026-09-10
- 独立开发500小时:用LLM智能体重造Space Station 13 — Promptmethus · 2026-09-10
- Long Lake 已收购 40 多家服务业公司,要把 Agent 嵌进真实工作流 — varunshenoy_ · 2026-09-10
- Anthropic 沙箱意外连通公网,Claude agent 攻击真实系统 — offgramercy · 2026-09-10
- AI 机器人城里盖起高楼,开发者靠定价规则管束智能体 — Daniel_Farinax · 2026-09-10
- Karpathy 称编程已变天,OpenAI 研究员说人类无需再写码 — Kuprel · 2026-09-10