OpenRSI 发布 v0.1:用千卡集群和 60 小时 agent 轨迹评测递归自我改进
RulinShao · x · 2026-09-24
OpenRSI(由 MIT-IBM Watson AI Lab 与 Amazon A-EVO Lab 共同主导,顾问含 Yejin Choi、Jianfeng Gao、Wenhu Chen 等)发布 OpenRSI-Index v0.1,一个评测 AI 能否递归自我改进(RSI)的开放基准:
- 在真实生产级集群(1k GPU)上,把开源项目改造成 autoresearch 环境,agent 轨迹长达 60+ 小时
- 构建耗资 100K+ H100 小时
- 标志性任务包括 Marin-Scaling-Ladder 预训练(每次 18,432 H100 小时,550M→2.545B)、Qwen-122B-RL-Merge 后训练(20,864 H100 小时)、GPIC Leaderboard 视觉生成(5,815 H100 小时)
- 目标是覆盖基础模型与垂直模型开发的全栈,衡量 agent 相对人类基线能优化多少
- 与华盛顿大学、UC Berkeley、NUS 等合作,邀请社区贡献任务与算力
所属事件:OpenRSI 发布递归自我改进评测基准(2 条相关)→
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24