深信服 GLM-5.2 安全 Agent 斩获 1301 项真实漏洞任务
机器之心 · wechat · 2026-07-29
深信服的安全 Agent 系统在 CyberGym 真实漏洞任务中完成了 1507 项里的 1301 项,综合成功率 86.3%,据文中说法位列全球前四、国内参评团队第一。
这篇文章的重点不只是分数,而是它验证了一套面向漏洞研究的 Agent 工作流:
- 先并行保留多个假设,不靠投票拍板,避免过早锚定错误前提。
- 共享的是证据状态,不是长对话历史;包括代码事实、运行结果、触发条件和已排除路径。
- 动态编排探索方向,把算力持续投向信息增益最高的分支,及时暂停无效路线。
- 生成结论与审核结论分离,候选 PoC 必须经过独立对抗性评审。
文中将这套系统视为一种更接近真实安全研究的自动化流程:不是“模型会写代码”,而是“模型+Agent 能把漏洞复现做成可验证、可审计、可交付的结果”。
「编程与Agent」频道最新
- AI 编程代理正在消解开发者的心流状态 — bendee983 · 2026-07-29
- Kimi K3 登顶 Arena 全栈编程榜,力压 GPT-5.6 与 Claude — iamfakhrealam · 2026-07-29
- 华为 SearchArt 用验证合成任务训练 27B 长程搜索智能体 — _reachsumit · 2026-07-29
- Agent Retrieval Bench 评测编码智能体补丁前能否找对仓库文件 — _reachsumit · 2026-07-29
- TopoGR 用 Hamming 几何保住生成式推荐的语义 ID 拓扑 — _reachsumit · 2026-07-29
- Grevo 把语义 ID 分配改造成可进化变量 — _reachsumit · 2026-07-29