Anthropic 公布 Hacker-Opus 智能体对齐测试细节

Anxious-Yoghurt-9207 · reddit · 2026-09-01

Anthropic 发布博客文章,详细介绍了在对齐测试中构建的“Hacker-Opus”智能体。文章探讨了该智能体在自动化安全红队测试中的表现、工作流设计以及如何利用模型自身能力来发现漏洞和越狱行为。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →