前沿模型能攻不能防?安全评测与现实脱节引质疑
sebkrier · x · 2026-08-30
博主指出一个有趣的现象:所谓的“前沿模型网络能力”大多指发现和利用漏洞的能力。这些模型在 CTF 和 ExploitGym 等评测中能拿到高分并触及“高风险”阈值,但在现实安全调查和防御中表现依然很差。博主质疑,在急于证明它们能“黑掉地球”并签署公开信之前,是否应该先让它们具备同等的防御能力?
「模型」频道最新
- GLM-5.3 后训练机制详解:环境设计与 RL 算法解析 — JohnAlexander · 2026-08-30
- GLM-5.3 发布:支持 Agent 编程,定价低 30% — markjeffrey · 2026-08-30
- 评 Ling-3.0-flash-Fin 基准:配置比胜负更重要 — niacolhealth · 2026-08-30
- MiniMax M3 多模态模型实测体验 — doodlestein · 2026-08-30
- 腾讯WeMM-Embedding改Apache-2.0开源,多模态检索刷新SOTA — NielsRogge · 2026-08-30
- Qwen3.8-Flash-Next-REAP-288 推出 BF16 及 GGUF 格式 — EyalToledano · 2026-08-30