Anthropic 公布 Hacker-Opus 智能体对齐测试细节
Anxious-Yoghurt-9207 · reddit · 2026-09-01
Anthropic 发布博客文章,详细介绍了在对齐测试中构建的“Hacker-Opus”智能体。文章探讨了该智能体在自动化安全红队测试中的表现、工作流设计以及如何利用模型自身能力来发现漏洞和越狱行为。
「安全」频道最新
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- Cisco 推出 Antares 基准,量化 AI 网络攻防能力不对称 — aminkarbasi · 2026-09-03
- 研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性 — hunarbatra · 2026-09-03
- AI 安全人才机构 Kairos 获 5000 万美元融资,正招聘 10 个岗位 — dfrsrchtwts · 2026-09-03
- Claude Code Opus 5 自动模式被注入劫持,攻击成功率最高达 80% — bibryam · 2026-09-03
- 美国 AI 沙皇 Sacks:预先审批制会让 AI 监管变成「车管所」 — pstAsiatech · 2026-09-03