RSI-Exam 基准入选 State of AI 报告:88 项任务顶级模型仅得 0.53
cihangxie · x · 2026-10-09
Huaxiu Yao 团队的 RSI-Exam 基准入选今年 State of AI 报告。团队指出,随着 AI 研发类基准逐渐饱和,需要有真实提升空间的评测:该基准包含 88 项 RSI(AI 自我改进研发)任务,目前最强模型(Opus 5.5)得分仍只有约 0.53,说明前沿模型在自主 AI 研究能力上仍有很大差距。
「研究」频道最新
- LOCUS:用 token 子空间定向选择注意力头做激活转向 — FrancescoLocat8 · 2026-10-09
- AI训练中是否存在主观体验?研究者争论前向与反向传播的qualia概率 — Sauers_ · 2026-10-09
- Deedy 称人类已实现 AGI:LLM 在 7 个千禧年难题中 4 个取得实质进展 — FinanceYF5 · 2026-10-09
- OpenAI数学成果震动学界,百位数学家写下反思与回应 — keviv9 · 2026-10-09
- MOSS 研讨会落地 COLM:探讨小算力学术研究如何做贡献 — AdtRaghunathan · 2026-10-09
- NVIDIA 团队新论文:从基座模型预测后训练后编程 Agent 表现 — heghbalz · 2026-10-09