Scale AI 发布 RSI Bench:600 多个提案衡量 AI 自主推进研究
alexandr_wang · x · 2026-09-22
Alexandr Wang 转发 Scale AI 的 RSI Bench 进展:已收到 600 多个任务提案,正邀请顶尖贡献者在公共仓库中构建任务,并邀请「递归自我改进」概念先驱 Jürgen Schmidhuber 出任高级顾问。
RSI Bench 旨在衡量 AI 智能体能否通过开放式、迭代式研究来推进 AI 研发本身。官方博客详细介绍了验证流程:
- 任务设计:每个任务给智能体固定资源预算和一个含可复现基线与验证反馈回路的研究环境,智能体可多轮实验、迭代想法;最终提交由独立的隐藏评估器在 held-out 条件(未见过的数据、模型或环境)下打分。
- 验证管线:基于 Terminal-Bench 的验证流程扩展到迭代研究场景,使用 Harbor 任务格式,逐条审查提案是否指令欠/过约束、验证是否只奖励部分有效解、数据划分是否奖励记忆而非泛化、结果是否对超参数敏感、基线是否达到前沿水平。
- 动机:只有当分数提升反映真实能力提升时 benchmark 才有意义,因此需防止代理奖励失真、评估器被钻空子等失效模式。
「模型」频道最新
- Grok 九周连发三版:4.5 到 4.7 迭代节奏惊人 — XFreeze · 2026-09-22
- 曝 OpenAI 赶造 Codex Bot 对标 Grok Bot,并发文谈递归自我改进 — dotey · 2026-09-22
- 工程师用 Agent 集群 20 小时自主训出对标 Jev 的模型,总花费仅 3100 美元 — denisyarats · 2026-09-22
- 博主发起挑战:记录每日 token 消耗,验证 AI 公司是否暗中降限额 — tomchapin · 2026-09-22
- Grok 4.7 上手首日:严格遵循 system prompt,实测优于 4.5 — elonmusk · 2026-09-22
- MoVA 新架构:稀疏值专家提升注意力容量且不增 KV 缓存 — rupspace · 2026-09-22