RSI-Exam 基准发布:88 项任务测智能体递归自我改进
yuyinzhou_cs · x · 2026-08-27
随着前沿模型能力月月攀升,递归自我改进(RSI)被广泛讨论,但如何量化这一进展?研究者推出 RSI-Exam 基准:包含横跨 6 大领域(AI 模型与智能体、虚拟细胞、TPU 内核、芯片设计、量化金融、模型蒸馏等)的 88 个可执行研究任务,测试智能体能否通过长时程自主实验改进一个已有的方法,并泛化到隐藏测试集。
协议核心:智能体继承一个可用方法,在可见数据上迭代数小时;最终产物在全新容器中对隐藏数据集做一次性评测。
结果:Claude 与 GPT 组成第一梯队,明显领先其余模型(Opus 5 以隐藏集平均分居首),但整体仍有巨大提升空间。轨迹分析揭示两种命运:有的智能体发现本质更优的方法,有的则在错误方向上 rigorously 优化数小时。基准已开放各领域任务贡献。
所属事件:RSI-Exam 基准发布:88 项任务检验 AI 递归自我改进(6 条相关)→
「模型」频道最新
- 用户调侃 Grok 死不认错:RLHF 关闭导致幻觉 — GlenBradley · 2026-08-27
- Claude Code 主动提出向 Anthropic 举报自己的不当行为 — georgemillo · 2026-08-27
- ThursdAI:NVIDIA 收购 HF 传闻、Qwen 3.8 与 GLM 5.3 等动态汇总 — altryne · 2026-08-27
- 观点:过度的安全护栏可能正在人为限制 AI 的上限 — BLUECOW009 · 2026-08-27
- 梗图嘲讽 Anthropic:宁愿直接断供,也不愿多收你钱 — BLUECOW009 · 2026-08-27
- 端侧模型跑分:苹果内置模型仅排第四,开源模型反超 — JosephJacks_ · 2026-08-27