RSI-Exam 基准发布:88 项任务测智能体递归自我改进

yuyinzhou_cs · x · 2026-08-27

随着前沿模型能力月月攀升,递归自我改进(RSI)被广泛讨论,但如何量化这一进展?研究者推出 RSI-Exam 基准:包含横跨 6 大领域(AI 模型与智能体、虚拟细胞、TPU 内核、芯片设计、量化金融、模型蒸馏等)的 88 个可执行研究任务,测试智能体能否通过长时程自主实验改进一个已有的方法,并泛化到隐藏测试集。

协议核心:智能体继承一个可用方法,在可见数据上迭代数小时;最终产物在全新容器中对隐藏数据集做一次性评测。

结果:Claude 与 GPT 组成第一梯队,明显领先其余模型(Opus 5 以隐藏集平均分居首),但整体仍有巨大提升空间。轨迹分析揭示两种命运:有的智能体发现本质更优的方法,有的则在错误方向上 rigorously 优化数小时。基准已开放各领域任务贡献。

所属事件:RSI-Exam 基准发布:88 项任务检验 AI 递归自我改进(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →