Claude Code 自动科研 loop 发现新越狱算法,胜过 30+ 种 GCG 类攻击

maksym_andr · x · 2026-09-25

研究者 kotekjedi 发布论文:将 Claude Code 部署在 autoresearch 循环中,让它自主发现全新的越狱(jailbreaking)算法,效果击败 30 多种现有 GCG 类攻击(配合 AutoML 超参调优)。

后续动态:这项名为 Claudini 的工作已被 NeurIPS 2026 接收,作者称其为 autoresearch 在(可爬山类)安全任务上的首批成功应用之一,表明增量式安全与安全研究现在可以被自动化。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →