前沿模型安全差异巨大:最弱仅需58美元即可越狱

S_OhEigeartaigh · x · 2026-08-02

FAR AI 的一项测试对四个前沿大模型使用了相同的越狱问题。结果显示,模型在安全性上存在巨大差异:最弱的模型仅需 58 美元 的成本就能被攻破,而最坚固的模型坚持到了 14,200 美元 以上。

这意味着模型间的安全抗性差距高达约 170 倍。此外,这种严重的安全隐患完全无法在常规的能力基准测试中体现出来。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →