Claude 新模型基准测试曝光:TBS 科学分 52.6%
eyishazyer · x · 2026-09-02
引用推文展示了一款新模型(可能是 Claude)的基准测试成绩。该模型在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,而 Fable 5 为 42.0%。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- OpenAI 请用户用 /feedback 提交 Astra 异常样本,修复赶在 6.1 发布前 — ivan_bezdomny · 2026-09-12
- 开发者谈 Astra:别当升级版编码模型,当个难搞的天才用 — kevinkern · 2026-09-12
- Yoav Artzi 评价 Astra:空间推理能力是代际跃升 — yoavartzi · 2026-09-12
- Muse Spark 1.3 max 上线 contributor 档,订阅计划 5 美元起 — jordiae · 2026-09-12
- Zed CEO 晒图:一条链接耗掉约一半 Claude 订阅额度 — zeeg · 2026-09-12
- 演示称 GPT-6 Astra 可实现视频生成精确相机控制 — round · 2026-09-12