RSIArena 首阶段收官:GPT-6 Astra 夺冠,Grok 4.7 断粮仍居前二
RSIArena 自主模型训练竞赛第一阶段收官:让 AI 智能体作为「研究员」自主训练模型、再由人类盲评对抗的实验顺利完成,OpenAI 的 GPT-6 Astra 夺冠,xAI 的 Grok 4.7 在资源被提前切断的情况下仍位居前二,第二阶段人类反馈赛随即开赛。这一结果被视为 AI 自主研究能力的一次直观展示,值得关注。
已确认
- 竞赛规则:10 个 AI 研究员模型使用同一个 NVIDIA Nemotron 底座,各获 1000 GPU 小时预算,自行选择数据、编写训练代码、跑实验并提交各自训出的模型。
- 盲测投票共收到 1685 票,OpenAI GPT-6 Astra 排名第一。
- Grok 4.7 因 API 额度提前 41 小时耗尽而被切断,近 70% 的 GPU 预算尚未动用,但其训练出的模型仍排进前二(多篇帖子表述为前二或前三内,主帖称第二)。
- 发帖人 @mycatcancode 向 Elon Musk 转述并称赞 xAI 团队表现,表示期待第二轮;该项目合作方包括 Hugging Face 等方(m4 提及)。
- Stage 2 以人类反馈为核心的赛程已经开赛。
为什么重要
- 该竞赛直接检验了「AI 训练 AI」的自主研究(RSI)能力:在同一底座与同等算力约束下比较各前沿模型的自主实验能力,GPT-6 Astra 的夺冠与 Grok 4.7 的逆势表现都成为评估各家模型自主研究水平的参照点。
- Grok 4.7 在资源大幅缩水的情况下仍获前二,这一反差引发包括马斯克被 @ 在内的关注,也为后续 Stage 2 的人类反馈赛增加了看点。
2026-10-12 ~ 2026-10-12 · 5 条相关
一手来源
- RSIArena 模型自训练赛:GPT-6 Astra 夺冠,Stage 2 人类反馈开赛 — my_cat_can_code ·
- RSIArena 首轮:GPT-6 Astra 夺冠,Grok 4.7 用七成算力也进前三 — my_cat_can_code ·
- Grok 4.7 提前断粮仍拿第二:RSIArena 竞赛趣闻引马斯克关注 — my_cat_can_code ·
- 【源头】RSIArena 模型自训练赛:GPT-6 Astra 夺冠,Stage 2 人类反馈开赛 — my_cat_can_code · 2026-10-12
- RSI Arena 第一阶段收官:AI 自训模型冲进人类评测前二 — my_cat_can_code · 2026-10-12
- Grok 4.7 提前 41 小时被断供,训练模型仍冲进 RSIArena 前二 — my_cat_can_code · 2026-10-12
- 【源头】RSIArena 首轮:GPT-6 Astra 夺冠,Grok 4.7 用七成算力也进前三 — my_cat_can_code · 2026-10-12
- 【源头】Grok 4.7 提前断粮仍拿第二:RSIArena 竞赛趣闻引马斯克关注 — my_cat_can_code · 2026-10-12