RSI-Exam 基准发布:量化 LLM 自演化能力

cihangxie · x · 2026-08-27

RSI-Exam 是一个新的基准,旨在量化 LLM 的递归自我改进(RSI)能力。它不测模型修改自身权重,而是测试智能体能否通过数小时的自主实验改进“可执行的工作产物”,并在隐藏测试集上验证泛化性。基准包含 88 个任务(35 公开 + 53 私有),覆盖物理科学、AI 模型、系统硬件等 6 大领域。榜单显示 Claude 和 GPT 构成第一梯队,但距离理想上限仍有巨大空间。

所属事件:RSI-Exam 基准发布:88 项任务检验 AI 递归自我改进(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →