OpenRSI 发布 RSI 评测基准 v0.1:千卡集群测试 AI 能否自我改进
hhsun1 · x · 2026-09-24
开源组织 OpenRSI 发布 OpenRSI-Index v0.1,一个评估 AI「递归自我改进」(RSI)能力的开放基准:
- 将完全开源的项目改造成「自动科研环境」,跑在生产规模的 1000 GPU 集群上
- Agent 轨迹可持续 60+ 小时,构建 v0.1 花费超过 10 万 H100 小时
- 核心问题:AI 能否系统性地超越人类设计的方法,真正扩展科学与智能的边界
UPenn 宾大 NLP 组(hhsun1)表示这与他们的工作直接相关,并列出系列成果:ScienceAgentBench(ICLR 2025,用真实论文中的数据驱动发现任务严格评测 agent)、AutoSDT(EMNLP 2025,从开源仓库自动扩展高质量科研编码任务以训练「co-scientist」)、以及 D3-Gym(在 AutoSDT 基础上加可验证环境与评测脚本)。
所属事件:OpenRSI 发布递归自我改进评测基准(2 条相关)→
「编程与Agent」频道最新
- Codex 双智能体同时开发 iOS 与 Android 应用并提交商店上架 — burkov · 2026-09-24
- 《你对 AGENTS.md 的理解几乎为零》:一文讲透编码工具说明书之争 — dotey · 2026-09-24
- 60k token 强制换人实验:12 个 Terminal-Bench 任务 10 个仍通过 — key_of_door · 2026-09-24
- 独立开发者开源Tapioca:Go写的本地终端编码Agent — Practical_Witness_95 · 2026-09-24
- Anthropic 上线 Claude Marketplace:2000+ 连接器,可买第三方 Agent — claudeai · 2026-09-24
- 为多 Agent 并行而生:开发者发布 Mac 终端 Nyx,内置浏览器与 MCP — henrymodis · 2026-09-24