RSIArena 模型自训练赛:GPT-6 Astra 夺冠,Stage 2 人类反馈开赛
my_cat_can_code · x · 2026-10-12
RSIArena 第一阶段收官:10 个模型作为「AI 研究员」,基于同一 Nemotron 底座、各得 1000 GPU 小时,自行选数据、写训练代码、跑实验并提交模型。盲评共收到 1685 票,OpenAI GPT-6 Astra 第一,Grok 4.7 和智谱 GLM-5.3 分列二三位。Grok 4.7 因 API 额度提前 41 小时耗尽被中断,GPU 预算仍剩近 70%,但训出的模型仍进前二。
第二阶段 10 月 10–13 日进行,每个模型从自己的 checkpoint 恢复,加入 arena 战斗的人类反馈、500 GPU 小时和 150 美元 API 额度,由 agent 自行决定如何解读反馈与调整训练,训练过程直播,checkpoint 与数据将在 Hugging Face 开源。合作方包括 Hugging Face、Scale AI、圣母大学、华盛顿大学和斯坦福。
所属事件:RSIArena 首阶段收官:GPT-6 Astra 夺冠,Grok 4.7 断粮仍居前二(5 条相关)→
「漫话AGI」频道最新
- Derya Unutmaz:两年前预言应验,AI 不能做的事正趋近于零 — DeryaTR_ · 2026-10-12
- AI 科学家预测:十亿 AI 科学家将攻克人类衰老 — Dr_Singularity · 2026-10-12
- Steve Yegge 力荐:我们真正追求的是「适应性复杂性」 — Steve_Yegge · 2026-10-12
- 「你好 Elena,今天有什么新鲜事」:一句问候暴露了人对 AI 的信任问题 — relic_radiation · 2026-10-12
- AI 真正颠覆的不是 Photoshop,而是庞大隐形定制软件市场 — bennash · 2026-10-12
- AlphaGo 亲历者撰文:别被骗了,LLM 并不会真正推理 — luislamb · 2026-10-12