GPT-6 疑似血洗 SRE-Bench:pass@4 接近 100%,二进制逆向也快失守
xennygrimmato_ · x · 2026-09-04
SRE-Bench 作者 i2huer 披露:OpenAI 数周前告知其 GPT-6(Astra)在该软件逆向工程基准上 pass@4 解题率接近 100%、pass@1 约 88%,且成本更低。SRE-Bench 的测试程序全部为 2024 年前、从未公开的私有二进制,可基本排除数据污染,社区还在贡献混淆器与加壳工具加固基准。作者感叹前沿模型在网络安全分析(包括二进制分析)上的进步仍令人震惊,并公开征集新的私有程序与反分析工具。
基准要求:私有且 2024 年前构建、可编译为原生二进制(C/C++/Rust/Go)、支持确定性的多任务自动评分,规模约 5000-30000 行。
所属事件:OpenAI 称 GPT-6 在软件逆向基准 SRE-Bench 近满分(2 条相关)→
「模型」频道最新
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- OpenAI 官员确认:Astra 纳入套餐正常用量,额度可 100% 划拨 — soumitrashukla9 · 2026-09-05
- 罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分 — danielmckinn0n · 2026-09-05
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- TheZvi 解读 Claude Fable 5.1 系统卡:200+ 页安全评估要点 — TheZvi · 2026-09-05
- COLM 论文:思维链看着可读不等于真的重要 — LauraRuis · 2026-09-05