RSI-Exam 基准入选 State of AI 报告:88 项任务顶级模型仅得 0.53

cihangxie · x · 2026-10-09

Huaxiu Yao 团队的 RSI-Exam 基准入选今年 State of AI 报告。团队指出,随着 AI 研发类基准逐渐饱和,需要有真实提升空间的评测:该基准包含 88 项 RSI(AI 自我改进研发)任务,目前最强模型(Opus 5.5)得分仍只有约 0.53,说明前沿模型在自主 AI 研究能力上仍有很大差距。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →