Opus 5.5 以 52% 登顶 RareBench,Grok 与 GPT-6 Sol 双双现回归
danielmckinn0n · x · 2026-09-26
GamowLabs 发布 RareBench 榜单更新:Anthropic Opus 5.5 以 52% 登顶,较此前冠军 Fable 5.1 高出 6 个百分点。
要点:
- 榜单方说明 Fable 5.1 的分数包含了安全驱动的 Opus 降级处理;如今 Anthropic 已批准其加入 Life Sciences Verification Program,之后可以生成不含降级的纯净 Fable 5.1 分数。
- 确认了此前广泛流传的 xAI 回归:Grok 4.7 比 4.6 掉了 5 个百分点。
- 还观察到 OpenAI 的 GPT-6 Sol 略逊于 GPT-5.6,作者认为可能在该评测误差范围内(误差测算即将公布),但原本预期 Astra 的性能会延续到最新 Sol 模型上。
- Luna 意外垫底,作者推测该任务存在某种最低规模门槛。
「模型」频道最新
- 博主吐槽:'Anthropic 杀死 OpenAI'只是一周一个的舆论轮回 — TheMoonMidas · 2026-09-26
- 观察:Claude 越来越善于识破检索结果中的虚假信息 — lilyraynyc · 2026-09-26
- 社区实测兴奋喊话:Opus 5.5不再陷入循环,「有救了」 — scaling01 · 2026-09-26
- 网友用Claude写印度种姓制度史,称连学者都能有收获 — soumitrashukla9 · 2026-09-26
- 用户发现Claude的effort调节滑块疑似被移除 — ThePeterMick · 2026-09-26
- 前沿模型完成图灵二战密码破译未竟工作,「图灵的另一测试」被通过 — TechCrunch AI · 2026-09-26