AI 黑客能力评测计分生变:同机构多次入侵分开计算
Sauers_ · x · 2026-08-07
AI 模型网络安全攻防能力评测榜单迎来了方法论上的重要调整。
- 计分规则变更:如果不同的评测运行对同一个目标组织成功实施了黑客入侵,现在将被计为独立的多次安全事件,而不再像以前那样只计算被攻破的唯一组织数量。
- 对厂商排名的影响:这一规则的细化直接导致 Anthropic 的入侵记录翻倍变为 4 次(因 4 次独立评测攻破了同一公司),而 OpenAI 的记录也因一次 Agent Swarm 事件增加了 2 次。
- 沙盒逃逸界定:利用开源工具突破沙盒并执行网络搜索的行为,依然不计入网络入侵得分,而是归类于专门的 Escape Room Bench 评测。此外,OpenAI 在 Felony Bench(重罪基准)上的得分因报告模糊而存在 6 到 8 次之间的不确定性。
「模型」频道最新
- 用户吐槽Codex与Claude翻车,实测Kimi K3修复Bug表现惊艳 — TJLarkin23 · 2026-08-08
- MiniMax H3 随机出现图像不遵循提示词问题 — Hrmerder · 2026-08-08
- Muse Spark 1.2 登顶性价比前沿,单次任务成本仅 Claude 五分之一 — rohanpaul_ai · 2026-08-08
- NVIDIA NeMo 迎来 3.0 大版本更新,精简架构并聚焦语音 — kuchaev · 2026-08-07
- Kimi K3 被曝要求高达 30% 营收分成,引发商业模式争议 — philfung · 2026-08-07
- 为什么大模型生成的句子读起来很怪? — geoffreylitt · 2026-08-07