RSIArena 直播实验:8 个 Agent 用同一 30B 基座自学做后训练研究
my_cat_can_code · x · 2026-09-30
与 Stanford、Notre Dame、UW 和 Scale AI 合作的 LIVE RSIArena 项目正在测试一个核心问题:前沿模型能独立完成多少后训练研究?
实验设置:8 个研究 agent,全部基于同一个 30B 基座模型,共享 64 张 RTX PRO 6000 Blackwell GPU 集群,共运行 144 小时。每个 agent 获得 1000 GPU 小时,自行选择数据、编写训练代码并跑实验;提交的模型会被冻结后独立评测,即「模型训练模型」的公开直播实验。
团队还将在 COLM 2026 设展位并举办直播活动,欢迎后训练、agent 与评测方向的从业者反馈。
所属事件:RSIArena 直播实测:8 个同底座 Agent 自主做 144 小时后训练研究(8 条相关)→
「编程与Agent」频道最新
- 「新基准」梗:用整页飞机图纸测图生 CAD 能力 — burhop · 2026-09-30
- 结构性确定性法则:策略执行别交给 LLM 判断 — forevergeeks · 2026-09-30
- 「Agent 版 Gumroad」实验:你出创意我管托管 — BLOOD-STROKE · 2026-09-30
- Matt Pocock 将直播访谈 poteto,聊 agent 编程技能与高效交付 — mattpocockuk · 2026-09-30
- mitsuhiko 呼吁 MCP 支持可组合的工具搜索 — mitsuhiko · 2026-09-30
- TDX MCP 服务器开源发布:41 个工具让 AI 管理工单与 CMDB — modelcontextprotocol · 2026-09-30