FAR.AI 发布 AI 安全榜单,Grok 与 Gemini 遭遇数百种越狱
The Cognitive Revolution · rss · 2026-07-31
FAR.AI 联合创始人兼 CEO Adam Gleave 在播客中介绍了首个系统性的 AI 安全排行榜,对前沿大模型实际部署的滥用防护措施进行了评估。
核心发现:
- 防御差异显著: Claude Fable 5 和 GPT-5.6 Sol 顶住了测试套件,而 Grok 4.5 和 Gemini 3.1 Pro 则以极低成本被攻破,产生了数百个通用越狱方法。
- 攻击手段: 许多有效的攻击看起来更像“社会工程学”而非高级机器学习技术。
- 安全建议: 不应过度依赖所谓的“越狱税”来保障安全,需要建立多层次的防御机制。
讨论强调了在威胁行为者广泛利用强大系统之前,AI 开发者必须能够测量并加固真实的防御能力。
「模型」频道最新
- Inkling-Small 登顶 AudioMC,工具调用仅次 Kimi K3 — ziqiao_ma · 2026-07-31
- AI 模型行为钟摆:学者吐槽从「谄媚」走向了「过度挑剔」 — emollick · 2026-07-31
- Senior SWE-Bench 更新:三大模型并列第一,引入多次试验降方差 — ajratner · 2026-07-31
- 本地运行 Kimi K3 需 1.56TB 显存,仅顶级芯片可承载 — ArtificialAnlys · 2026-07-31
- 开源模型加速专业化,后训练技术栈正全面成型 — bigdata · 2026-07-31
- 猜测:某公司借机抢占市场,推理利润率高于预期 — ivan_bezdomny · 2026-07-31