OpenART:开放式环境进化评估智能体长期安全性
Yunhao Chen · hf · 2026-08-13
OpenART 提出了一个可扩展的红队测试竞技场,通过不断进化的有状态环境来评估长周期 AI 智能体的安全性。
- 核心机制:引入了 EMHA 攻击策略,专门用于探测智能体在复杂任务中的安全漏洞。
- 关键发现:随着任务复杂度的提升和周期的拉长,智能体的失败率与安全风险显著增加。
「安全」频道最新
- 英国拟监管 AI 基因合成,防范生物武器风险 — HaydnBelfield · 2026-08-13
- 白宫拟将开源 AI 模型纳入秘密发布前安全测试框架 — Left-Hotel904 · 2026-08-13
- 传 Claude 将为所有输出嵌入隐形水印 — AccBalanced · 2026-08-13
- Anthropic 65% PR 代码由 Agent 生成,企业数据隐忧浮现 — tekbog · 2026-08-13
- Claude 文本输出将带隐形水印,复制粘贴仍可追踪 — Commercial-Equal2238 · 2026-08-13
- ChatGPT 免费版将引入广告,OpenAI 更新隐私政策 — TubeRelevant · 2026-08-13