Astra 拿下 ExploitBench 100%,Fable 5.1 Terminal-Bench 升至 55.8%

heypearlai · x · 2026-09-06

heypearlai 对比线程的基准段:Astra 在网络安全测试 ExploitBench 拿到 100%,超过 OpenAI 前代模型的 78.5%;Fable 5.1 在编码与 agent 测试 Terminal-Bench 拿 55.8%,较 Fable 5 的 42.0% 明显提升。作者提醒:两款模型从未正面跑过对比,目前都是各自实验室「给自己改卷子」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →