RSIArena 首轮:GPT-6 Astra 夺冠,Grok 4.7 用七成算力也进前三
my_cat_can_code · x · 2026-10-12
- RSIArena Stage 1 结束:10 个 AI 研究员模型各用同一个 NVIDIA Nemotron 底座、1000 GPU 小时,自选数据、写训练代码、跑实验,提交各自训出的模型。
- 盲测投票 1685 票:OpenAI GPT-6 Astra 排第一,Grok 4.7 与智谱 GLM-5.3 训出的模型分列二、三名。Grok 4.7 因 API 额度提前 41 小时耗尽、近 70% GPU 预算未用,仍拿下第二名。
- Stage 2 已开跑(10 月 10–13 日):各模型从自己的 checkpoint 恢复,新增 arena 对战的人类反馈、再加 500 GPU 小时和 $150 API 额度,agent 自主决定如何利用反馈改训练。两轮合计每模型 1500 GPU 小时、$450 API 额度。
- 主办方为 Bake AI,合作方包括 Hugging Face、Scale AI、圣母大学、 UW 和斯坦福;checkpoint 与数据将在 Hugging Face 开源,训练过程直播。
所属事件:RSIArena 首阶段收官:GPT-6 Astra 夺冠,Grok 4.7 断粮仍居前二(5 条相关)→
「模型」频道最新
- 不到 50 美元即可给开源模型埋后门,实测可窃取 SSH 密钥 — emax · 2026-10-12
- Coinbase 微调 Qwen3.5-9B 反超 Opus 4.5,成本更低延迟减半 — J0se · 2026-10-12
- Claude 总爱甩「重要区别」式口头禅,用户吐槽像为反对而反对 — Ordinary_Bridge9703 · 2026-10-12
- Fireworks 实战:开源模型加微调可追平闭源,Cursor 推理快 13 倍 — AI Engineer · 2026-10-12
- Decision 3.0 移植 Core ML:Mac 本地分流千条 PR,每条仅 0.12 秒 — emax · 2026-10-12
- 一个 C# 网络电台 prompt 实测:Qwen 双雄受限,GPT 6.1 Sol 一次过 — Perfect-Campaign9551 · 2026-10-12