Astra 拿下 ExploitBench 100%,Fable 5.1 Terminal-Bench 升至 55.8%
heypearlai · x · 2026-09-06
heypearlai 对比线程的基准段:Astra 在网络安全测试 ExploitBench 拿到 100%,超过 OpenAI 前代模型的 78.5%;Fable 5.1 在编码与 agent 测试 Terminal-Bench 拿 55.8%,较 Fable 5 的 42.0% 明显提升。作者提醒:两款模型从未正面跑过对比,目前都是各自实验室「给自己改卷子」。
「模型」频道最新
- 新模型 Astra 拒写选举投票率建模代码,护栏引研究者围观 — sethlazar · 2026-09-06
- 长周末福利:Grok Bot 为全体用户重置用量限额 — Baconbrix · 2026-09-06
- 传闻前沿模型是 48 层循环两次,DeepLoop 论文探索深度扩展 — dotey · 2026-09-06
- Ultra 用户吐槽 Astra 不听指令:同 prompt 下 Sol 稳定遵从,Astra 自行发挥 — PurpleManner5207 · 2026-09-06
- Ethan Mollick:前沿模型已是两家公司的竞赛 — emollick · 2026-09-06
- 实测:15 分钟 CAD 任务几乎耗尽 5 小时使用额度 — _Stocko_ · 2026-09-06