长程网络安全能力差距缩小
rohanpaul_ai · x · 2026-07-18
这条帖转述了一组关于长时程网络安全能力的评测结果:在 AISI 的 32 步 “The Last Ones” cyber range 上,最新开放权重模型与闭源前沿模型之间的差距,已经从 2025 年大部分时间里的约 6–10 个月,缩小到约 4–7 个月。
图中同时给出两类结果:在长时程 cyber range 上,GLM-5.2 的表现接近约 4 个月前发布的闭源模型;而在 AISI 的 32 步任务里,GPT-5.6 Sol 在 100M token 预算下 10 次里有 7 次完成全部 32 步。作者强调:随着推理 token 增加,模型能力会继续上升,也就是说,攻击/防御能力可以通过增加运行时算力而显著增强,而不一定需要重新训练。
所属事件:AISI称开源模型缩小网络安全差距(6 条相关)→
「模型」频道最新
- 曝 OpenAI 暂停 $200 ChatGPT Pro 套餐,Grok 4.7 恰逢其时上线 — iannuttall · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11