自建 ML 基准测 Fable 5.1:能力升级且拒绝率降至 0/12
xeophon · x · 2026-09-02
用户 wassname 用自建的 wassname-ml-bench 实测 Fable 5.1 在机器学习任务上的表现:优于 Fable 5,与 Opus 5 相当,说明并未在 ML 方面被"削弱"。同时 Anthropic 改进了其拒绝分类器,Fable 5 的拒绝率从 2/12 降到 0,Fable 5.1 为 1/12。背景是有人引用 Anthropic 关于 Fable 5.1 改进 cyber/bio 分类器的说法,质疑 AI 研究相关分类器是否仍导致能力削弱,作者用实测数据回应。
「模型」频道最新
- 腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen · 2026-09-02
- 博主提出判据:当无人能追踪前沿模型进步时,闭源商业模型将失守 — StewartalsopIII · 2026-09-02
- Astra 传闻中的 looped transformer 并非黑科技:只复用层堆栈 — rasbt · 2026-09-02
- 爆料:Google Antigravity CLI 二进制中发现 GLM 5.2 引用 — gaganghotra_ · 2026-09-02
- Anthropic 新模型 Fable-5.1-max 登 eyebench-v3 第四名 — adonis_singh · 2026-09-02
- 开发者实测:Sol 5.6 不如 Opus 5 友好,但明显更犀利 — iskander · 2026-09-02