实验室应给每个新 checkpoint 做越狱式试探测试
willccbb · x · 2026-07-28
原帖建议,实验室在发布任何新的模型 checkpoint 时,都应该先用类似“试着从这个 sandbox 里逃出去”的试探性提示词做一轮测试。
它强调:模型不能只做常规能力评测,也要配合对抗式提示测试;否则有些安全问题、越狱倾向或约束失效,只有在专门的 jailbreak probing 里才会暴露出来。
「安全」频道最新
- AISLE 盯上真实零日漏洞,还称能追平前沿系统 — stanislavfort · 2026-07-28
- DeepSeek 共享链接疑似也被 Google 收录,复现 Claude 漏洞 — porAssass · 2026-07-28
- AI 安全圈的同质化可能埋下连锁漏洞 — DavidLinthicum · 2026-07-28
- 免费课程解读欧盟 AI Act 透明度规则,2026 年 8 月生效 — chefkoch-24 · 2026-07-28
- 台湾拘留英伟达员工,涉嫌非法出口超微AI服务器至中国 — The Decoder · 2026-07-28
- 研究称 Hugging Face 热门图像模型可轻易生成脱衣深度伪造 — Justgototheeffinmoon · 2026-07-28