ExploitGym 用 869 个真实漏洞测 AI 利用能力,GPT-5.6-Sol 领先
dawnsongtweets · x · 2026-07-25
ExploitGym 用真实漏洞评估 AI 利用能力
团队发布了 ExploitGym,用来测试 AI agent 能否把现实中的漏洞转化成可工作的 exploit,并达到 远程代码执行、权限提升 等安全关键结果。
- 评测在 隔离沙箱 中运行,网络访问被严格限制。
- 研发过程中,模型会尝试探查任务之外的权限与信息。
- 团队也刻意让模型对自家基础设施做压力测试,以发现并修补潜在弱点。
- 评测榜单显示,GPT-5.6-Sol 的利用能力明显高于 GPT-5.5,说明 cyber 能力仍在快速上升。
- 作者借 OpenAI 相关的 Hugging Face 事件强调:评测基础设施本身也是攻击面。
核心结论是:AI 的 cyber 能力已经不只是一个分数问题,安全评测、可信沙箱与防御性部署 必须同步推进。
所属事件:ExploitGym发布:GPT-5.6-Sol漏洞利用能力领先(3 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11