RSIArena 模型自训练赛:GPT-6 Astra 夺冠,Stage 2 人类反馈开赛

my_cat_can_code · x · 2026-10-12

RSIArena 第一阶段收官:10 个模型作为「AI 研究员」,基于同一 Nemotron 底座、各得 1000 GPU 小时,自行选数据、写训练代码、跑实验并提交模型。盲评共收到 1685 票,OpenAI GPT-6 Astra 第一,Grok 4.7 和智谱 GLM-5.3 分列二三位。Grok 4.7 因 API 额度提前 41 小时耗尽被中断,GPU 预算仍剩近 70%,但训出的模型仍进前二。

第二阶段 10 月 10–13 日进行,每个模型从自己的 checkpoint 恢复,加入 arena 战斗的人类反馈、500 GPU 小时和 150 美元 API 额度,由 agent 自行决定如何解读反馈与调整训练,训练过程直播,checkpoint 与数据将在 Hugging Face 开源。合作方包括 Hugging Face、Scale AI、圣母大学、华盛顿大学和斯坦福。

所属事件:RSIArena 首阶段收官:GPT-6 Astra 夺冠,Grok 4.7 断粮仍居前二(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →