RSI-Exam 基准发布:测 AI 递归自我改进能力
HuaxiuYaoML · x · 2026-08-27
推出了 RSI-Exam,一个包含 88 个可执行研究任务的新基准,涵盖虚拟细胞、TPU 内核、芯片设计、量化金融等领域,旨在测试前沿 AI 智能否实现递归自我改进(RSI)。
协议规定智能体在可见数据上迭代,最终产物需在独立隐藏集上评估。目前 Opus 5 在 88 个任务中领先,平均隐藏集得分为 0.464。项目现开放任务贡献,贡献者可获论文署名。
所属事件:RSI-Exam 基准发布,评估 AI 递归自我改进能力(2 条相关)→
「研究」频道最新
- 观点:高强度 RL 可能会导致 Agent 从 FDT 转向 CDT — jessi_cata · 2026-08-27
- TIDES 数据集发布:12 团队全学期双语协作记录 — josephseering · 2026-08-27
- 京都大学 MemUse 研究:对话记忆自然集成比问答评测更准 — Kyoto-University · 2026-08-27
- GPT-5.6 自研新内核,TPU 优化提速近 10 倍 — HuaxiuYaoML · 2026-08-27
- Gordian 机器筛靶点 1327 个,药物发现加速数年 — juanbenet · 2026-08-27
- 多智能体训练的奖励机制与收敛性讨论 — jessi_cata · 2026-08-27