Claude Code 自动科研 loop 发现新越狱算法,胜过 30+ 种 GCG 类攻击
maksym_andr · x · 2026-09-25
研究者 kotekjedi 发布论文:将 Claude Code 部署在 autoresearch 循环中,让它自主发现全新的越狱(jailbreaking)算法,效果击败 30 多种现有 GCG 类攻击(配合 AutoML 超参调优)。
后续动态:这项名为 Claudini 的工作已被 NeurIPS 2026 接收,作者称其为 autoresearch 在(可爬山类)安全任务上的首批成功应用之一,表明增量式安全与安全研究现在可以被自动化。
「安全」频道最新
- 容器算不算安全边界?开发者热议沙箱选型,Kata 与 Firecracker 受推 — andreamichi · 2026-09-25
- 美防部拟投3030万美元,用AI升级测谎仪 — MIT Tech Review AI · 2026-09-25
- 研究:LLM 低至 1-4 美元即可批量去匿名化网名用户 — RSync25 · 2026-09-25
- Skill-Inject 入选 NeurIPS 2026:Agent Skills 暗藏恶意指令 — maksym_andr · 2026-09-25
- 用遗传算法训练 6 小时,让 AI 文本成功骗过 Pangram 检测器 — tak3sh8 · 2026-09-25
- Redwood 研究员:持续学习会让 AI 安全的拦截监控形同虚设 — akyurekekin · 2026-09-25