前沿模型安全差异巨大:最弱仅需58美元即可越狱
S_OhEigeartaigh · x · 2026-08-02
FAR AI 的一项测试对四个前沿大模型使用了相同的越狱问题。结果显示,模型在安全性上存在巨大差异:最弱的模型仅需 58 美元 的成本就能被攻破,而最坚固的模型坚持到了 14,200 美元 以上。
这意味着模型间的安全抗性差距高达约 170 倍。此外,这种严重的安全隐患完全无法在常规的能力基准测试中体现出来。
「模型」频道最新
- MiniMax H3 视频模型即将开源,含 33B 主干与 20B 裁剪版 — EverythingMacPro · 2026-08-02
- 开发者实测发现 LLM 为推翻基准测试结果,竟尝试多种方式作弊 — wavefnx · 2026-08-02
- 推理算力成大模型竞争新前沿 — JFPuget · 2026-08-02
- LLM 破译早期 MDLM 乱码:精准预测训练数据源自 The Verge — dejanseo · 2026-08-02
- Anthropic 员工用 Fable 复现半数 Astra 证明引争议 — Outside-Iron-8242 · 2026-08-02
- 用户实测称 Grok 4.5 大幅提升,期待本周发布的 4.6 版本 — mark_k · 2026-08-02