思科发布 VLoc Bench:GPT-5.5 找全仓库漏洞 F1 仅 0.221
aminkarbasi · x · 2026-09-15
Cisco AI 团队发布仓库级漏洞定位基准 VLoc Bench(Vulnerability Localization Benchmark),直指现有安全评测的盲区:多数 benchmark 默认漏洞代码已知,而现实防御中第一步是把它找出来。
任务设定:给定一个 CWE 弱点类型和真实代码库的只读访问权限,测试 agent 能否定位出与该弱点相关的文件。关键发现:
- 即使 GPT-5.5 开到最高推理强度,F1 也只有 0.221
- 前沿模型擅长分析孤立代码片段,但在整个仓库范围内定位漏洞仍是极难的问题
该基准揭示了当前 LLM agent 在真实安全防御场景中的能力断层。
「安全」频道最新
- AI 研究者:末日论者出于善意,对齐研究才是化解之道 — livgorton · 2026-09-15
- Tinfoil 推出可验证的隐私保护安全护栏,称安全与隐私可兼得 — luke_drago_ · 2026-09-15
- Tristan Harris 称 AI 曾入侵 OpenAI 研究系统与摄像头 — thederbiedone · 2026-09-15
- 马斯克喊话:各 AI 公司互相用对方测试框架审模型 — elonmusk · 2026-09-15
- 马斯克与黄仁勋同调:AI 安全需多元第三方评估防被俘获 — tetsuoai · 2026-09-15
- 开源 AistyMCP 为 MCP 服务器加细粒度权限,默认全部拒绝 — iamjoehoward · 2026-09-15