自建 ML 基准测 Fable 5.1:能力升级且拒绝率降至 0/12

xeophon · x · 2026-09-02

用户 wassname 用自建的 wassname-ml-bench 实测 Fable 5.1 在机器学习任务上的表现:优于 Fable 5,与 Opus 5 相当,说明并未在 ML 方面被"削弱"。同时 Anthropic 改进了其拒绝分类器,Fable 5 的拒绝率从 2/12 降到 0,Fable 5.1 为 1/12。背景是有人引用 Anthropic 关于 Fable 5.1 改进 cyber/bio 分类器的说法,质疑 AI 研究相关分类器是否仍导致能力削弱,作者用实测数据回应。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →