RSIArena 直播实测:8 个同底座 Agent 自主做 144 小时后训练研究
RSIArena(由 Bake AI 主导,联合 Stanford、Notre Dame、UW 与 Scale AI)发起了一场直播实验,实测前沿模型能在多大程度上独立完成 post-training 研究。8 个研究智能体基于同一个基座模型 Nemotron 3.5 Lightning 30B-A3B 出发,在共享的 64 张 RTX PRO 6000 Blackwell 上各自开展约 144 小时的递归自我改进(RSI)研究,全程无专家介入,最终由人类评审评定胜负。实验在 COLM 2026(旧金山)现场开赛。
已确认
- 实验名称为 RSIArena,由 bakeaihq(Bake AI)主导,合作方包括 Stanford、Notre Dame、UW 与 Scale AI
- 8 个研究 agent,全部基于同一个 30B 基座模型(Nemotron 3.5 Lightning 30B-A3B)
- 算力配置:共享 64 张 RTX PRO 6000 Blackwell,每个 agent 获得 1000 GPU 时
- 每个 agent 另有 300 美元的 API 额度
- 实验以直播形式进行,时长约 144 小时,属于递归自我改进(RSI)实测
- Agent 需在无人类专家监督的情况下自主编排 agentic post-training 流程,胜负由人类评审评定
- 实验在 COLM 2026 现场开赛
为什么重要
- 这是公开直播环境下对「前沿模型能否独立完成后训练研究」这一核心问题的大规模实测,8 个 agent 同题同资源竞技的形式可横向比较不同方法的自主研究能力
- 每个参与者的资源(1000 GPU 时、300 美元 API 额度)被显式限定,使结果在成本可控条件下可比,为评估递归自我改进提供了可复现的参照框架
2026-09-29 ~ 2026-09-30 · 8 条相关
一手来源
- 八个 AI 智能体各拿 1000 GPU 时 live 比拼递归自我改进 — my_cat_can_code ·
- RSIArena 实验:8 个 agent 共享 64 张 Blackwell,各用 1000 GPU 时训模型 — my_cat_can_code ·
- 【源头】八个 AI 智能体各拿 1000 GPU 时 live 比拼递归自我改进 — my_cat_can_code · 2026-09-29
- 8 个研究 agent 用同一 30B 基模自学 144 小时,直播检验后训练能力 — my_cat_can_code · 2026-09-30
- 【源头】RSIArena 实验:8 个 agent 共享 64 张 Blackwell,各用 1000 GPU 时训模型 — my_cat_can_code · 2026-09-30
- RSI Arena 实测:8 个 AI Agent 同题自训练模型,人评定胜负 — my_cat_can_code · 2026-09-30
- 多机构联办研究 Agent 竞赛:无人类监督自主完成后训练 — my_cat_can_code · 2026-09-30
另有 3 条近重复转述:my_cat_can_code · my_cat_can_code · my_cat_can_code