RSI-Exam 榜单:Claude Opus 5.5 以 0.536 登顶力压 GPT-6
HuaxiuYaoML · x · 2026-10-02
- 新的 RSI-Exam 基准(Benchmarking Recursive Self-Improvement through Executable Research)公布榜单,测试 AI agent 能否在长时间自主实验中改进自身并泛化到未见数据,共 88 个可执行研究任务,覆盖 AI 模型与 Agent、物理科学与工程等 6 大领域。
- Claude Opus 5.5(Anthropic)以 0.5357 排名第一,在 full/public/private 各分项均领先。
- GPT-6-astra 以 0.5126 居第二。
- Grok 4.7 上榜得分 0.3842,较 Grok 4.6 的 0.3671 有所提升。
- Gemini 4 尚未上榜,作者预告「在路上」。
评测方式:agent 需进行数小时自主实验(优化解题方法或驱动冻结模型的 harness),最终在隐藏测试集上一次性评估。
「模型」频道最新
- 自适应努力是动态循环 Transformer 的杀手级应用 — willcb · 2026-10-02
- 开发者抱怨 Claude 与 Claude Code 越用越差,质量下滑引共鸣 — Pavan_Belagatti · 2026-10-02
- 无审查版 Abliterated Large V2 上线 Venice,面向安全研究匿名开放 — 0xAllen_ · 2026-10-02
- GLM 5.3 登陆 Cursor,Max 版登顶 CursorBench 4.0 开源模型榜首 — zainhas · 2026-10-02
- Anthropic 封号潮下 200 刀订阅难退款,网友求退款攻略 — lxfater · 2026-10-02
- 同一厂商自评自家模型:Opus 5.5 基准数据能信几分 — maier_ak · 2026-10-02