前沿模型数字母大翻车:Astra 93% 准确率,Fable 仅 53%

maksym_andr · x · 2026-09-18

maksymandr 发布一组针对「数字母」任务的模型实测。该任务简单但超出在 SWE-Bench、TerminalBench 等基准上刷满的前沿模型分布:

后续帖子还发现随机词序列数字母会触发 Fable 的生物安全护栏拒答,且 Fable 在长文本上多耗 3 倍以上 token、表现反而更差。

所属事件:数字母实测翻车:Fable 护栏误触、token 低效(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →