RSI-Exam 开放社区共建,测 Agent 递归自我改进
yuyinzhou_cs · x · 2026-08-28
RSI-Exam 是一个新的基准测试,旨在衡量 AI 代理的递归自我改进能力,即通过自主、长周期的实验来改进现有方法,并验证改进能否泛化到隐藏数据。
核心发现:
- 涵盖 6 个领域、88 个可执行研究任务。
- Claude 和 GPT 处于第一梯队,明显领先其他模型。
- 代理轨迹揭示了成功发现更好方法与失败的差异。
社区贡献方式:
- 研究任务设计:创建具有挑战性的可执行研究环境。
- 评审:评估任务设计、方法和指标。
- 轨迹审计:深入分析代理轨迹以验证评分真实性。
下次贡献截止日期为 2026 年 9 月 15 日。
所属事件:RSI-Exam 基准发布:88 项任务检验 AI 递归自我改进(7 条相关)→
「研究」频道最新
- OpenResearch 推出 AutoResearch:用 Agent 复现与自动化实验 arXiv 论文 — simonguozirui · 2026-08-28
- BioSecBench 发布:Opus 与 Grok 位列生物安全基准前二 — himanshustwts · 2026-08-28
- Science 刊文:AI 方法已能自动设计 RNA 治疗药物结构 — rishabh16_ · 2026-08-28
- 自动科研是科学终极形态,RL 探索新行为效率高 5 倍 — const_reborn · 2026-08-28
- Intrinsic Discovery 方法让模型无监督探索环境 — burny_tech · 2026-08-28
- 主动学习筛250万分子,找到阻断RAS驱动癌症新路径 — bravo_abad · 2026-08-28