RSI-Exam 发布:88 项任务检验 Agent 递归自我改进

HuaxiuYaoML · x · 2026-08-27

RSI-Exam 是一个新基准,检验前沿 AI agent 能否通过把弱方法改造成在隐藏数据上表现更好的方法,实现递归自我改进(RSI)。任务库含 88 项横跨 6 大领域的可执行研究任务,覆盖虚拟细胞、TPU 内核、芯片设计、量化金融、agent harness、模型蒸馏等,现已开放各领域任务贡献。

每项任务不是有标准短答案的问答,而是一个可执行研究环境,包含:可运行的初始工件、任务自带指标、供迭代研究的可见数据、用于最终评测的隐藏数据,以及固定研究预算。agent 可修改或替换继承的方法,关键在于最终工件在全新容器里于隐藏集重跑时是否依然表现更好。当前榜单上 Opus 5 以 0.464 领先 GPT-5.6-sol(0.433)与 GLM 5.3(0.403)。

所属事件:RSI-Exam 基准发布检验 AI 递归自我改进能力(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →