RSIArena 直播实验:8 个 Agent 用同一 30B 基座自学做后训练研究

my_cat_can_code · x · 2026-09-30

与 Stanford、Notre Dame、UW 和 Scale AI 合作的 LIVE RSIArena 项目正在测试一个核心问题:前沿模型能独立完成多少后训练研究?

实验设置:8 个研究 agent,全部基于同一个 30B 基座模型,共享 64 张 RTX PRO 6000 Blackwell GPU 集群,共运行 144 小时。每个 agent 获得 1000 GPU 小时,自行选择数据、编写训练代码并跑实验;提交的模型会被冻结后独立评测,即「模型训练模型」的公开直播实验。

团队还将在 COLM 2026 设展位并举办直播活动,欢迎后训练、agent 与评测方向的从业者反馈。

所属事件:RSIArena 直播实测:8 个同底座 Agent 自主做 144 小时后训练研究(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →