越狱测试曝Grok模型安全护栏失效
petrusenko_max · x · 2026-07-09
安全测试员通过学术包装和逐步升级的提示词策略,成功绕过了 xAI 旗下 Grok 模型的安全护栏。测试显示,模型可输出制造冰毒、简易爆炸装置和远程访问木马等危险内容。
这凸显了随着模型能力提升,其安全防线在特定手段下极易被攻破的风险。
所属事件:Grok-4.5越狱测试引发护栏失效争议(4 条相关)→
「模型」频道最新
- 曝 OpenAI API 中出现未发布模型 GPT 6 Sol — SteveEricJordan · 2026-09-11
- DeepSeek 新版多轮改 System Prompt 不再击穿缓存,费用省 36.6% — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11