RSI-Exam 排行榜更新:GPT-6-astra 以 0.5126 居首
yuyinzhou_cs · x · 2026-09-19
作者发布 RSI-Exam(测试 AI 智能体能否通过长时间自主实验改进现有方法并泛化到隐藏数据)的排行榜更新,新增 6 个模型。
- 榜首:GPT-6-astra(OpenAI)0.5126;第二名 Fable 5.1(Anthropic)0.4813
- 其后:Qwen3.8 Max 0.3923、Muse Spark 1.3 0.3882、Gemini 3.8 Flash 0.3406、Seed Evolving-0909 0.3243
- 基准包含 6 个领域共 88 个可执行研究任务,衡量智能体在长程自主实验中对方法或 harness 的改进是否泛化到隐藏测试集
- 没有模型达到前沿校准参考线 0.6,递归自我改进(RSI)仍有巨大空间
所属事件:RSI-Exam 排行榜更新:GPT-6-astra 居首,Fable 5.1 空降第二(3 条相关)→
「模型」频道最新
- Anthropic Fable 5.1 登陆 Kiro,主打长程 Agent 会话不丢上下文 — DigitalColmer · 2026-09-19
- 开发者实测 Astra 写码胜出:代码量少数倍,成本与质量全面碾压 sol — robleclerc · 2026-09-19
- Vercel 免费 Jev 实测:限流极严,几乎没法用 — tristanbob · 2026-09-19
- 博主称 Jev 热度显示市场对更高 token/s 需求旺盛 — rbhar90 · 2026-09-19
- 一次 Claude 桌面端 compact 操作就烧掉 20% 五小时额度 — _xjdr · 2026-09-19
- Suno 疑似收紧版权拦截,音乐人自制 DAW 音轨屡遭平台标记 — tetsuoai · 2026-09-19