Trail of Bits 拆解 1Password 报告:AI 修漏洞仅 26% 成功是被算法扭曲的
austinc3301 · x · 2026-09-15
安全公司 Trail of Bits 发文逐条反驳 1Password 8 月 6 日发布的 AI 补丁基准报告——该报告称 AI 模型只有 26% 的概率产出可用的安全修复,Trail of Bits 认为这一头条数字严重误导防守方。
其指出四个关键问题:
- 样本刻意挑难的:六个漏洞因修复复杂而被选中,各漏洞干净修复率实际从 3% 到 60% 不等,平均数高度依赖选了哪些漏洞。
- 22% 的数据被指示用错误修复方案:两组 prompt 明确让 agent 应用错误修复,却被计入总平均。
- 超过 1/3 的试验禁止测试:一种评测模式不允许 agent 编译或运行代码,占总数据 36%。
- 模型未跑最高档设置:只测了 GPT-5.5 中等 effort 和 Opus 4.8 高档,都没用最高配置。
作者担心防守方被头条数字吓退、放弃可用的 AI 修复工具。文中同时公布了自家咨询项目与 Patch the Planet 的人类/agent 补丁质量真实数据,并开源两个 agent skills:post-patch-validation(帮 agent 验证修复)和 review-walkthrough(帮工程师审查修复)。
「模型」频道最新
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15
- 国产多模态模型 ZDTaichu5.0-9B 登上 Hugging Face 趋势榜 — TaichuAI · 2026-09-15
- 8GB 显存跑 10Eros 视频模型:量化变体的取舍求助 — apostrophefee · 2026-09-15
- rasbt 用 Paint 复绘实测:只看最终结果的基准有多不靠谱 — rasbt · 2026-09-15
- Cristóbal Valenzuela 试用 Solaris 后直呼:网站要重新变好玩了 — c_valenzuelab · 2026-09-15
- Google DeepMind 拆解语音到语音模型:三个目标互相牵制 — AI Engineer · 2026-09-15