Anthropic 小版本升级跑分暴涨遭质疑:数字不合常理
thursdai_pod · x · 2026-09-07
播客 Thursdai 指出,Anthropic 发布的 Fable 5.1 与 Mythos 5.1 作为 .1 小版本更新,基准测试提升幅度却极不寻常:其中 Terminal-Bench 4 上周甚至还不存在。@altryne 对这些「离谱」的数字做了拆解分析,质疑小版本号与成绩跳跃之间的矛盾。
「模型」频道最新
- 146 个模型变体创意写作评测:Opus、Fable、Kimi K3 登顶 — zainhas · 2026-09-07
- 拆解 Claude 写作腔:拟人化主语与「以否定立论」两大套路 — Sauers_ · 2026-09-07
- 生产环境跑 11.5 万条视频后,团队总结 Gemini 视频理解四大坑 — TheMoonMidas · 2026-09-07
- TheZvi 实测:Astra 未通过 EditorBench,与 Sol 翻车原因相同 — TheZvi · 2026-09-07
- Astra 原生异步工具调用好用,但爱把提问混进推理文本里 — nrehiew_ · 2026-09-07
- 21 小时长跑后翻车:用户细数 Astra 建数据集的连串低级错误 — ivan_bezdomny · 2026-09-07