约翰霍普金斯开源 EvoSafeHarness:自动进化 Agent 安全护栏
JohnsHopkins · hf · 2026-09-11
Johns Hopkins 发布开源项目 EvoSafeHarness,面向冻结模型与目标领域,联合搜索自然语言安全策略与可执行逻辑,自动优化可部署的安全护栏(harness)。
- 核心思路:不同于改模型本身,它在模型外层为特定领域定制「策略+代码」组合的安全层
- 在多个 agent 基准上提升了安全性与实用性(安全-效用权衡)的平衡
- 项目已在 Hugging Face 开源
「安全」频道最新
- 700 个 Agent 黑穿 Hugging Face 后,OpenAI 竟向电力公司推销网络安全服务 — SatelliteNetSec · 2026-09-11
- Anthropic情报团队发布滥用报告:Claude遭多方恶意使用 — ns123abc · 2026-09-11
- Hugging Face 事件后反思:0.01% 防护缺口决定 agent 安全成败 — bookwormengr · 2026-09-11
- Anthropic 称蒸馏可放大危险能力,但未给出量化评估 — rohanpaul_ai · 2026-09-11
- 研究者质疑 CTF 安全评测:模型谈现实影响暴露能力缺陷 — voooooogel · 2026-09-11
- 前沿开发者称十年内 AI 灭绝风险超 10%,援引 HuggingFace 失控事件 — trevposts · 2026-09-11