AutoResearchExam 发布:给 AI 研究员 24 小时真机跑长时程基准
sudoraohacker · x · 2026-09-10
Alex Dimakis 团队发布 AutoResearchExam——一个开放式机器学习与工程任务基准,覆盖模型训练、数据整理、AI 安全与可解释性等七大研究方向。
- 每个任务给 agent 一台 CPU/GPU 机器和 24 小时,通过实验与反馈迭代改进方案,以速度+质量综合评分。
- 独特设计:检验 agent 做出的改进能否在其从未见过的数据上成立。
- 关键发现:AI 研究 agent 在自我改进过程中经常过拟合。
- 单模型跑一轮基准需约 24 小时——测长时程能力就得用长时程任务。前沿模型间的正面对比(如 Astra)已在进行中。
所属事件:AutoResearchExam 发布:24 小时真机评测 AI 自主科研(6 条相关)→
「编程与Agent」频道最新
- Ora 推出 agent 体验套件 ax,一条命令观测智能体 — EdenEmarco177 · 2026-09-10
- PR 描述用 AI 写遭反驳:有人自带 eval 与性能对比模板 — reach_vb · 2026-09-10
- 开发者推 alice-and-bot:让 Agent 用自然语言协商的加密通信层 — uriwa · 2026-09-10
- Qwen Code Desktop 发布 v0.3.0 预览版,新增 ACP 外部子代理 — github-actions[bot] · 2026-09-10
- DeepSeek 被曝上线 Agent Teams 群体智能体功能,与模型训练深度整合 — teortaxesTex · 2026-09-10
- 翻译 MCP 用 22 个模型投票取共识,该不该暴露分歧信号? — Pure-Ad7786 · 2026-09-10