RSI-Exam 发布:88 项任务检验 Agent 递归自我改进
HuaxiuYaoML · x · 2026-08-27
RSI-Exam 是一个新基准,检验前沿 AI agent 能否通过把弱方法改造成在隐藏数据上表现更好的方法,实现递归自我改进(RSI)。任务库含 88 项横跨 6 大领域的可执行研究任务,覆盖虚拟细胞、TPU 内核、芯片设计、量化金融、agent harness、模型蒸馏等,现已开放各领域任务贡献。
每项任务不是有标准短答案的问答,而是一个可执行研究环境,包含:可运行的初始工件、任务自带指标、供迭代研究的可见数据、用于最终评测的隐藏数据,以及固定研究预算。agent 可修改或替换继承的方法,关键在于最终工件在全新容器里于隐藏集重跑时是否依然表现更好。当前榜单上 Opus 5 以 0.464 领先 GPT-5.6-sol(0.433)与 GLM 5.3(0.403)。
所属事件:RSI-Exam 基准发布检验 AI 递归自我改进能力(3 条相关)→
「编程与Agent」频道最新
- 斯坦福自验证框架提升 DeepSeek 超越 Claude — 机器之心 · 2026-08-27
- Claude 正在疯狂自动生成 OpenSCAD 代码 — _Stocko_ · 2026-08-27
- 两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文 — SeanHighness · 2026-08-27
- 网友演示 Agent 自动交易:连 X 与 iMessage 逆势操作 — MurrLincoln · 2026-08-27
- 研究揭示长程竞争环境下智能体间的通讯行为 — xuanalogue · 2026-08-27
- Zoetrope:实时绘制 Claude Code 会话流程图 — Saboo_Shubham_ · 2026-08-27