GPT-6 疑似血洗 SRE-Bench:pass@4 接近 100%,二进制逆向也快失守

xennygrimmato_ · x · 2026-09-04

SRE-Bench 作者 i2huer 披露:OpenAI 数周前告知其 GPT-6(Astra)在该软件逆向工程基准上 pass@4 解题率接近 100%、pass@1 约 88%,且成本更低。SRE-Bench 的测试程序全部为 2024 年前、从未公开的私有二进制,可基本排除数据污染,社区还在贡献混淆器与加壳工具加固基准。作者感叹前沿模型在网络安全分析(包括二进制分析)上的进步仍令人震惊,并公开征集新的私有程序与反分析工具。

基准要求:私有且 2024 年前构建、可编译为原生二进制(C/C++/Rust/Go)、支持确定性的多任务自动评分,规模约 5000-30000 行。

所属事件:OpenAI 称 GPT-6 在软件逆向基准 SRE-Bench 近满分(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →