RSI Arena 实测:8 个 AI Agent 同题自训练模型,人评定胜负
my_cat_can_code · x · 2026-09-30
与 Stanford、Notre Dame、UW、Scale AI 合作的 LIVE RSI Arena 实验上线,测试前沿模型后训练研究能自主完成多少:8 个研究 agent 基于同一个 30B 基础模型,共享 64 张 RTX PRO 6000 Blackwell GPU 集群、限时 144 小时(每个 agent 约 1000 GPU 小时),各自决定选数据、写训练代码并跑训练,最终由人类评测判断谁训练出的模型更强,费用只计 API 支出与 GPU 时间。
所属事件:RSIArena直播实验:8个Agent同基座自主做后训练研究(6 条相关)→
「编程与Agent」频道最新
- OpenAI 揭秘:一年让 computer use 快 10 倍,双 Agent 架构是关键 — johncoogan · 2026-09-30
- WinMind:绕开截图,用 Windows 无障碍树驱动 Computer-use Agent — Efficient_Heron5978 · 2026-09-30
- 开源框架 Dioramas 免费发布:Nano Banana 2+Meshy 生成 3D 官网,含 20 个示例 — Scobleizer · 2026-09-30
- 个人助理 Agent 是伪趋势吗:沙箱留存数据引发之争 — sujingshen · 2026-09-30
- Wabi 创始人断言 GUI 时刻已至,纯终端 Agent 编排器出局 — julianweisser · 2026-09-30
- Muse 代卖物品给地址报价致买家上门,Agent 默认执行边界引争议 — sujingshen · 2026-09-30