数字母实测翻车:Fable 护栏误触、token 低效
开发者 maksymandr 发布一系列针对「数字母」任务的模型实测,结果显示 Fable 5.1 在这个远低于 SWE-Bench、TerminalBench 等主流基准分布的简单任务上全面翻车,凸显前沿 LLM 在分布外泛化上的失败。
已确认
- 让 Fable 5.1 数随机词组(如「circulation roulette mixed」)中的字母这类完全无害的请求,会触发生物安全护栏导致拒答,作者汇总了被拒内容,并发现模型还会因此被降级到 Opus;作者吐槽该模型因此「基本不可用」。
- 低推理强度下,GPT-6-Astra 在 1280 字符文本上保持 93% 准确率,Fable 仅 53%。
- Fable 仅当输入达到约 320 字符才启用思考 token;即使 20 字符的短句也常数错,不用思考本可提升准确率,暴露其自适应思考机制的问题。
- 在 1280 字符长文本任务上,Fable 消耗超过 3 倍的 token,成绩反而更差;Astra 用更少 token 达到更高准确率。
为什么重要
- 该实验说明在主流基准上刷满的前沿模型,面对简单分布外任务仍可能严重失败,基准成绩与真实可用性存在落差。
- 安全护栏对无害输入的误拦截,以及思考触发阈值与 token 效率问题,都直接影响模型的实际可用性与成本。
2026-09-18 ~ 2026-09-18 · 5 条相关
一手来源
- 数个字母竟触发 Fable 生物安全拦截,简单实验暴露前沿 LLM 泛化失败 — maksym_andr ·
- 前沿模型数字母大翻车:Astra 93% 准确率,Fable 仅 53% — maksym_andr ·
- 实测:Fable 只在 320 字符以上才思考,数短句仍频出错 — maksym_andr ·
- 【源头】前沿模型数字母大翻车:Astra 93% 准确率,Fable 仅 53% — maksym_andr · 2026-09-18
- 【源头】实测:Fable 只在 320 字符以上才思考,数短句仍频出错 — maksym_andr · 2026-09-18
- 实测:Fable 数字母比 Astra 多耗 3 倍 token 且更差 — maksym_andr · 2026-09-18
- 实测:Fable 5.1 数字母会误触发安全护栏,拒答随机词序列 — maksym_andr · 2026-09-18
- 【源头】数个字母竟触发 Fable 生物安全拦截,简单实验暴露前沿 LLM 泛化失败 — maksym_andr · 2026-09-18