RSI-Exam 排行榜更新:GPT-6-astra 居首,Fable 5.1 空降第二
递归自我改进基准 RSI-Exam 发布排行榜更新,用于测试 AI 智能体能否通过长时间自主实验改进现有方法并泛化到隐藏数据。本次新增多个前沿模型成绩:GPT-6-astra 以 0.5126 继续位居榜首,Anthropic 的 Fable 5.1 以 0.4813 空降第二,Meta 的 Muse Spark 与字节等厂商的模型也一同入榜。
2026-09-18 ~ 2026-09-19 · 3 条相关
- RSI-Exam 榜单更新:GPT-6-astra 居首,Fable 5.1 空降第二 — HuaxiuYaoML · 2026-09-18
- RSI-Exam 排行榜更新:GPT-6-astra 以 0.5126 居首 — yuyinzhou_cs · 2026-09-19
另有 1 条近重复转述:airesearch12