OpenRSI 发布 RSI 评测基准 v0.1:千卡集群测试 AI 能否自我改进

hhsun1 · x · 2026-09-24

开源组织 OpenRSI 发布 OpenRSI-Index v0.1,一个评估 AI「递归自我改进」(RSI)能力的开放基准:

UPenn 宾大 NLP 组(hhsun1)表示这与他们的工作直接相关,并列出系列成果:ScienceAgentBench(ICLR 2025,用真实论文中的数据驱动发现任务严格评测 agent)、AutoSDT(EMNLP 2025,从开源仓库自动扩展高质量科研编码任务以训练「co-scientist」)、以及 D3-Gym(在 AutoSDT 基础上加可验证环境与评测脚本)。

所属事件:OpenRSI 发布递归自我改进评测基准(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →