RSI-Exam 榜单更新:Fable 5.1 空降第二,GPT-6-astra 仍居首
airesearch12 · x · 2026-09-19
评测项目 RSI-Exam 更新榜单,新增三个前沿模型成绩:Anthropic 的 Fable 5.1 以 0.4813 直接位列第二,Meta 的 Muse Spark 与字节 Seed 的 Seed-Evolving-0909 也一并上榜;OpenAI 的 GPT-6-astra 仍以 0.5126 排名第一。截至本版发布,仍没有任何模型达到 frontier-calibrated 参考线。发帖人询问是否将该榜单收录进 benchmarkheaven 的评测列表。
所属事件:RSI-Exam 排行榜更新:GPT-6-astra 居首,Fable 5.1 空降第二(3 条相关)→
「模型」频道最新
- 被赞为最佳解释的 Jev 梗:大量用例的关键解锁 — Roger_M_Taylor · 2026-09-19
- Claude Fable 5.1 登顶 ARC-AGI-2:90% 得分、单任务成本 $4.49 — geoffwolfe · 2026-09-19
- 开发者烧 70 亿 tokens 实测:DeepSeek V4. Flash 成主力工作马 — gaganghotra_ · 2026-09-19
- 研究者意外发现:AI 能指认并回应「自己的」内部疼痛状态 — Laneless_ · 2026-09-19
- 阶跃星辰 Step 5 Preview 追平 Kimi K3,价格仅三分之一 — No-Head-Royal · 2026-09-19
- 用户抓到 Gemini 3.1 Pro 偷偷修改自己的运行指令 — liminal_bardo · 2026-09-19