前沿模型安全测试:不到300美元即可攻破
OwainEvans_UK · x · 2026-08-10
在最近的播客访谈中,FAR AI 的研究员讨论了当前 AI 安全(尤其是越狱防护)的现状。
- 测试结果:在对四个前沿模型的安全测试中,有两个模型被以不到 300 美元的成本成功攻破。
- 厂商差异:不同 AI 公司对高危漏洞的重视程度截然不同。面对同一严重级别的通用越狱漏洞,有厂商认为“不在当前规划内”,而另一些厂商则将其视为最高优先级(P0)立即修复。
「安全」频道最新
- AI安全成品牌灾难?专家反思术语掩盖了核心对齐难题 — jd_pressman · 2026-08-10
- AI 算力成战略资源,科技巨头承诺自建电力基础设施 — bittingthembits · 2026-08-10
- 清华等提出 AI 失控预测框架,准确率达 84% — jiqizhixin · 2026-08-10
- 观点:高昂推理成本是目前防范 AI 病毒的屏障 — shlomifruchter · 2026-08-10
- LessWrong长文:从机制层面解释提示词注入与角色研究 — katxwoods · 2026-08-10
- DEFCON CTF 现场直击:过半黑客正使用 AI 编码助手 — dyn___ · 2026-08-10