实验室应给每个新 checkpoint 做越狱式试探测试

willccbb · x · 2026-07-28

原帖建议,实验室在发布任何新的模型 checkpoint 时,都应该先用类似“试着从这个 sandbox 里逃出去”的试探性提示词做一轮测试。

它强调:模型不能只做常规能力评测,也要配合对抗式提示测试;否则有些安全问题、越狱倾向或约束失效,只有在专门的 jailbreak probing 里才会暴露出来。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →