RSI-Exam 榜单更新:GPT-6-astra 居首,Fable 5.1 空降第二
HuaxiuYaoML · x · 2026-09-18
递归自我改进基准 RSI-Exam 更新了榜单,新增三家前沿模型入榜:
- GPT-6-astra 仍以 0.5126 位居第一
- Fable 5.1(Anthropic)首发即 0.4813 排名第二
- Meta 的 Muse Spark 与字节 Seed-Evolving-0909 也已入榜
- 截至本版,仍没有任何模型达到 frontier-calibrated 参考线
RSI-Exam 通过可执行研究任务评估 AI 智能体能否在长周期中自我改进并泛化到未见数据:智能体需进行数小时自主实验来优化解题方法或驱动冻结模型的 harness,最后在隐藏测试集上跑一次定胜负。基准含 88 个公开任务,覆盖 AI 模型与智能体、物理科学与工程等 6 大领域,如 Lean 4 证明搜索工作流设计、3D 高斯泼溅压缩、外行星透射光谱反演等。
「研究」频道最新
- 衰老生物学迎来 AI 开放基准:配套专用语言模型登 Cell 旗下期刊 — marinkazitnik · 2026-09-18
- 基因组语言模型 gLM2 可控生成全新酶结构域架构 — BrianHie · 2026-09-18
- 片段距离建模提升发色团光学性质预测,TDiMS 优于大模型从头学习 — bravo_abad · 2026-09-18
- UVFaceFusion 开源:3 秒内重建拓扑一致的野外多视角 3D 人脸 — rsasaki0109 · 2026-09-18
- 云天筱 ProgramAsWeights:英文写 AI 函数,编译后离线跑在 CPU 上 — yuntiandeng · 2026-09-18
- 机器学习期刊 TMLR 告别 Medium,正式上线自家博客 — thegautamkamath · 2026-09-18