SEMA 框架:无需人工脚本训练多轮对抗模型自动化越狱对齐系统
burkov · x · 2026-09-30
安全研究者 Andriy Burkov 介绍 SEMA 框架,针对多轮对话场景下的 AI 安全威胁:恶意用户可跨多轮逐步掩盖有害意图、布置上下文,而现有攻击方法面临探索复杂度高和意图漂移(长对话容易跑偏到无害话题)等问题。
- SEMA 可训练开源语言模型自动生成多轮越狱攻击
- 不依赖人工编写脚本、预定义策略模板、外部越狱语料或闭源 API
- 旨在解决多轮交互下意图逐渐漂移的难题,为安全对齐研究提供自动化红队工具
「安全」频道最新
- OpenAI 发布 GPT-6.1 Sol 系统卡:网络安全评级达 Critical — maksym_andr · 2026-09-30
- 安全老兵长文:AI 正在终结黑客手艺的稀缺性 — joshua_saxe · 2026-09-30
- Hugging Face 被黑时的讽刺一幕:闭源模型拒援,开源 GLM 5.2 出手防御 — kuchaev · 2026-09-30
- 白宫签署行政令:官方文件中 Artificial Intelligence 改称 Super Intelligence — XFreeze · 2026-09-30
- 18 个月从边缘到共识:第三方嵌入评估成前沿 AI 政策支柱 — deanwball · 2026-09-30
- 实验室使用数据争议:Transluce 式外部验证或成出路 — agstrait · 2026-09-30