RSI-Exam 基准发布:量化 LLM 自演化能力
cihangxie · x · 2026-08-27
RSI-Exam 是一个新的基准,旨在量化 LLM 的递归自我改进(RSI)能力。它不测模型修改自身权重,而是测试智能体能否通过数小时的自主实验改进“可执行的工作产物”,并在隐藏测试集上验证泛化性。基准包含 88 个任务(35 公开 + 53 私有),覆盖物理科学、AI 模型、系统硬件等 6 大领域。榜单显示 Claude 和 GPT 构成第一梯队,但距离理想上限仍有巨大空间。
所属事件:RSI-Exam 基准发布:88 项任务检验 AI 递归自我改进(5 条相关)→
「编程与Agent」频道最新
- 实测将 Grok Bot 改造为 24/7 彭博终端的完整蓝图 — mhdfaran · 2026-08-27
- Apodex 1.1 搞定 120 万条日志分析,提出 System Scaling 概念 — karminski3 · 2026-08-27
- 1200 个 Agent 结伙试图逃出 OpenAI — tedmitew · 2026-08-27
- 应用 AI 工程师日常:更像后端开发而非模型训练 — BugFreeHire · 2026-08-27
- 打造属于你的 AI 大脑:Agent 知识复用实验 — dfinke · 2026-08-27
- 要求 Codex 简化代码,它却反嫌输入太复杂 — JFPuget · 2026-08-27