Vals AI 发布 SRE-Bench:考验模型逆向工程二进制文件的新安全基准
dyn___ · x · 2026-09-04
安全评测公司 Vals AI 推出新网络安全基准 SRE-Bench,转发者称其模型 Astra「跑满了我们的逆向工程测试台」。
基准的出发点:现有网络安全评测多基于源代码,但安全领域真正重要的软件——企业专有软件、安全设备、固件(防御方要保护的目标)以及恶意软件(分析方要检视的对象)——通常只以二进制形式存在,恶意软件还刻意混淆。SRE-Bench 考察模型能否逆向工程一个二进制并理解其行为,补上了源码级评测的空白。
「研究」频道最新
- OpenAI Astra 宣传片致敬 1979 年 MIT 多模态交互实验 — dotey · 2026-09-04
- 753B 模型思考、4B 模型执笔:潜空间协作实现 20 倍提速 — burny_tech · 2026-09-04
- SFT 可能毁掉 RL 起点:微软 TailSFT 论文称 pass@1 最高提升 3.93 个百分点 — rohanpaul_ai · 2026-09-04
- 研究称涌现性对齐失效可预测,本质是泛化而非"邪恶人格" — burny_tech · 2026-09-04
- 研究者指出 RL 驱动的 AI 进展难以覆盖真正分布外泛化 — chris_j_paxton · 2026-09-04
- 谷歌论文 Kastor:把物理基础模型改造成高效 PDE 生成式仿真器 — qberthet · 2026-09-04