Astra 在 ExploitBench 拿满分,官方自建变体重测漏洞利用能力
inductionheads · x · 2026-09-03
Andrew Ginns 称 Astra 模型在漏洞利用基准 ExploitBench 上取得 100% 满分,因此团队搭建了内部变体基准,以更准确地衡量其漏洞利用能力。这也侧面说明原基准已被能力天花板「打穿」,失去了区分度。
「模型」频道最新
- Claude Fable 5.1 高配版以 92.3% 刷新 WeirdML 评测 SOTA — teortaxesTex · 2026-09-03
- 分析称 OpenAI 若在 Astra 上用 Looped Transformer,必已验证可扩展 — teortaxesTex · 2026-09-03
- 企业宁多付数倍用 token 计费,数据保留担忧让 AI 订阅折扣失灵 — random_walker · 2026-09-03
- antirez:编码评测基准多是「垃圾」,与训练实际能力严重脱节 — antirez · 2026-09-03
- 阿里云联合 Hermes 办 200+ 人活动,展示 Qwen 3.8 全系模型 — Teknium · 2026-09-03
- 3595 条回复复测 15 个模型:上次的两条爆点结论全部翻车 — nejcar20 · 2026-09-03