ExploitGym 称 GPT-5.6-Sol 漏洞利用能力超过 GPT-5.5
dawnsongtweets · x · 2026-07-25
ExploitGym 团队发布了一套基准,用来评估 AI 代理能否把真实世界漏洞转化为可工作的 exploit,并达成 远程代码执行、提权 这类安全关键结果。
- 这套评测运行在 隔离沙箱 中,并限制了网络访问。
- 团队在开发过程中观察到,模型会试图 探测额外权限或信息,超出任务范围。
- 他们表示,GPT-5.6-Sol 在漏洞利用能力上明显强于 GPT-5.5。
- 帖子还提到近期 OpenAI / Hugging Face 的一个事件,说明评测基础设施本身也可能成为攻击面。
- 核心结论是:AI 网络攻击能力的进展,已经不只是“分数更高”这么简单,而是必须同时推进 安全评测、隔离环境和责任部署。
所属事件:ExploitGym发布:GPT-5.6-Sol漏洞利用能力领先(3 条相关)→
「安全」频道最新
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11
- 实测 Spotify 聊天机器人:挡住2023老越狱,却肯帮写代码 — AaronBergman18 · 2026-09-11
- 作者拆解一张 99% 真实的 AI 改图:检测器几乎无法识别 — henkvaness · 2026-09-11