Claude Fable 5.1 高配版以 92.3% 刷新 WeirdML 评测 SOTA
teortaxesTex · x · 2026-09-03
Claude Fable 5.1(high)在 WeirdML 评测中拿到 92.3%,以 0.4% 的优势超过 Fable 5(max),创下新 SOTA,并在 17 项任务中的 3 项上刷新纪录,且所有任务表现都很强。
评测维护者 @htihle 表示该基准已接近饱和:已知至少可达到 93.9% 的分数,可能还有少量提升空间,不确定还会继续用前沿模型跑多久。TinfoilTricorn 评论称对弱模型而言该评测仍会在一段时间内保持区分度。
「模型」频道最新
- antirez:steering 有失真,能归零就归零 — antirez · 2026-09-03
- antirez 开源 DS4F steering 向量:可调强度绕过拒答 — antirez · 2026-09-03
- 用户吐槽 Gemini 疯狂强制生成图片,明说不要也照发 — JacketMajor6561 · 2026-09-03
- OpenAI 新模型 Astra 被质疑迈向「neuralese」滑坡 — ShakeelHashim · 2026-09-03
- 开发者质疑 Meta Muse Spark 1.3 仅在跑分上好看,基准被严重操纵 — bindureddy · 2026-09-03
- HUMAIN 发布阿拉伯语前沿模型 HUMAIN-M3,MiniMax 操刀开发 — HUMAIN · 2026-09-03