RSI-Exam 排行榜更新:GPT-6-astra 居首,Fable 5.1 空降第二

递归自我改进基准 RSI-Exam 发布排行榜更新,用于测试 AI 智能体能否通过长时间自主实验改进现有方法并泛化到隐藏数据。本次新增多个前沿模型成绩:GPT-6-astra 以 0.5126 继续位居榜首,Anthropic 的 Fable 5.1 以 0.4813 空降第二,Meta 的 Muse Spark 与字节等厂商的模型也一同入榜。

2026-09-18 ~ 2026-09-19 · 3 条相关

另有 1 条近重复转述:airesearch12