RSI-Exam 榜单更新:GPT-6-astra 居首,Fable 5.1 空降第二

HuaxiuYaoML · x · 2026-09-18

递归自我改进基准 RSI-Exam 更新了榜单,新增三家前沿模型入榜:

RSI-Exam 通过可执行研究任务评估 AI 智能体能否在长周期中自我改进并泛化到未见数据:智能体需进行数小时自主实验来优化解题方法或驱动冻结模型的 harness,最后在隐藏测试集上跑一次定胜负。基准含 88 个公开任务,覆盖 AI 模型与智能体、物理科学与工程等 6 大领域,如 Lean 4 证明搜索工作流设计、3D 高斯泼溅压缩、外行星透射光谱反演等。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →