模型拦截恶意负载,GLM 5.2 仍能分析
mishig25 · x · 2026-07-20
作者声称自己用同一份恶意数据集和同一个 prompt做了两次测试。
- 其中一个前沿模型在读到 C2 payload 后立刻硬拦截。
- 自托管的 GLM 5.2 则把样本完整分析了一遍。
帖子附上两份转录,想对比不同模型在面对恶意内容时的安全拦截与分析能力差异。
「安全」频道最新
- WIRED 深度:递归自我改进浪潮令前沿实验室研究者恐慌,多人辞职发声 — connoraxiotes · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 「警惕自认正义者」:Anthropic 被批肆意访问用户隐私数据 — aiamblichus · 2026-09-11
- OpenAI 向国会询问:全行业联合放缓 AI 研发是否合法 — The Decoder · 2026-09-11